Un experimento muestra que las técnicas de testing no ayudan a los agentes de código
Dan Luu probó 26 condiciones de prompt y cuatro skills con agentes de código en Rust. El default sin instrucciones superó a la media.
El desarrollo con agentes de código sigue en auge, pero la calidad del software resultante no parece mejorar. Para comprobar si guiar al agente con técnicas de testing recomendadas marca la diferencia, Dan Luu ha llevado a cabo un experimento con el formato de compresión Zstd, implementado en Rust. En lugar de comparar agentes entre sí, varió las instrucciones: desde "usa desarrollo guiado por pruebas" hasta "aplica métodos formales como Lean 4 o Verus". También añadió una serie de skills (asistentes de contexto) que el propio Codex sugería como útiles.
El agente era Codex con GPT-5.6 Sol, con esfuerzos medio y alto. Se evaluaron 26 condiciones de prompt, incluyendo también fuzzing, property-based testing, TDD, etc., además de 4 skills: las oficiales de Hegel, ECC y Trail of Bits, y una propia creada por Luu. El objetivo: medir cuántos de los 80 intentos superaban todas las pruebas ocultas.
La respuesta es decepcionante para quienes esperaban que una técnica concreta elevara la precisión. Ninguna condición supera claramente a las demás. De hecho, el "default" sin instrucciones se comporta por encima de la media. Con esfuerzo alto, las condiciones basadas en fuzzing y property-based testing rindieron ligeramente mejor que los métodos formales, pero a esfuerzo medio la diferencia era prácticamente nula y mezclada. Las skills recomendadas por el propio Codex no lograron mejorar el resultado; solo la skill propia de Luu, creada específicamente para el problema, quedó en un nivel razonable.
El autor había predicho antes de ejecutar que TDD empeoraría las cosas y que los métodos formales no superarían a otras técnicas. Ambas suposiciones se cumplieron a medias, aunque con poca confianza. Lo que sí parece claro es que añadir contexto o directrices complejas no beneficia por defecto a un agente de codificación; a veces solo añade ruido. Luu sugiere que, en lugar de depender de instrucciones aisladas, es más efectivo mejorar los datos y el entrenamiento de los modelos para que integren buenas prácticas de forma natural.
Este experimento abre preguntas sobre cómo evaluar y guiar a los agentes, y muestra que todavía queda trabajo para convertir las técnicas clásicas de testing en algo que los modelos usen de forma efectiva.


