Agentes de IA refactorizan 300 000 líneas de código C en tres semanas
CodeScene mostró que un conjunto de agentes basados en Claude Opus logró mejorar el Code Health de 5,6 a 10,0 en el código de Street Fighter III con 2 903 commits y un coste de unos 4 000 USD en tokens.

CodeScene ha publicado un caso de estudio donde agentes de IA refactorizaron una base de código C de 300 000 líneas —el proyecto de descompilación de Street Fighter III: 3rd Strike— en tres semanas. El proceso generó 2 903 commits que tocaron 726 archivos, modificó 252 055 líneas y elevó la puntuación de Code Health de 5,6 a 10,0. El coste de los tokens consumidos se estima en unos 4 000 USD.
El flujo de trabajo se apoyó en dos mecanismos. Primero, el CodeHealth MCP Server proporcionó una señal de calidad determinista que los agentes optimizaron. Segundo, un replay‑trace harness verificó la corrección comparando el hash del estado de retroceso fotograma a fotograma, garantizando que el comportamiento del juego permaneciera intacto tras cada cambio. Como resultado, los agentes no solo aplicaron refactorizaciones clásicas (por ejemplo, Extract Function o cláusulas de guardia), sino que también construyeron un “playbook” propio con 22 recetas y 82 notas de apoyo, entre ellas transformaciones específicas del juego como Shared Index Range o Uniform Step Table.
El modelo seleccionado fue Claude Opus mediante la variante Claude Code, que superó a Codex con Sol en la captura y documentación de patrones emergentes. Con modelos más pequeños, los agentes se estancaban en óptimos locales y no lograban avances significativos.
La reacción de la comunidad ha sido polarizada. Algunos profesionales, como Paolo Perrone, valoran la robustez del replay‑trace harness frente a simples suites de pruebas. Otros, como Konrad Otrębski, cuestionan la aplicabilidad a proyectos reales y piden ver el proceso completado en un proyecto de código abierto popular. Daniel Webb, CTO de NeoSee y co‑autor del experimento, confirmó que los cambios fueron integrados en la rama principal a través de 54 pull requests.
El estudio también abre preguntas sobre métricas no cubiertas: impacto en el rendimiento del juego, consumo de memoria o latencia de entrada, y la posible aparición de defectos que el harness no detectó. CodeScene planea usar las dos versiones generadas (una con Code Health 5,6 y otra con 10,0) en una investigación conjunta con la Universidad de Lund, donde estudiantes implementarán nuevas funcionalidades usando modelos de frontera para comparar coste y calidad.
Implicaciones: la experiencia demuestra que, con un entorno determinista y métricas de calidad claras, los agentes pueden ejecutar refactorizaciones a escala que antes requerían semanas de trabajo humano. Sin embargo, la dependencia de un oracle de comportamiento y la ausencia de pruebas de rendimiento limitan la transferencia directa a sistemas legados donde tales garantías no existen.

