BookinglyTech News
Infraestructura

La IA abarata el código y convierte la verificación en el cuello de botella

Anthropic escribe con Claude el 80% de su código, pero en seis meses sus tests se multiplicaron por diez y los trabajos de CI por 25. El problema ya no es generar, es demostrar que lo generado es seguro.

3 min de lecturaDev.to0 vistas

Anthropic contó en su blog cómo escala la infraestructura de CI que hay detrás de Claude, y el dato que circuló fue uno: el modelo escribe el 80% del código de la casa. El otro, más abajo y bastante menos citado, es el que le importa a quien opera esto: en seis meses su suite de tests se multiplicó por diez y los trabajos de CI por 25. No es una historia de comprar más cómputo y seguir. Es lo que pasa cuando generar código deja de ser el cuello de botella y el cuello de botella se muda a la verificación.

El cuello de botella no desaparece, se muda

Si un desarrollador cerraba cinco cambios por sprint y con un agente cierra veinte, no solo sube el rendimiento de desarrollo. Suben los pull requests, los caminos de código, las ejecuciones de tests, la carga de revisión, los despliegues y la cantidad de fallos que alguien tiene que investigar. La parte de generación escaló; todo lo que va detrás tiene que escalar con ella o se atasca. Un incremento de 25 veces en CI visto desde dentro es exactamente eso.

La decisión interesante de la publicación de Anthropic sobre su CI es el servicio de selección de tests. No ejecutan la batería completa en cada cambio: tiran de un análisis determinista de impacto que elige pruebas según la relevancia del paquete y su comportamiento histórico. Si un agente hace un cambio de dos líneas y le respondes con una regresión entera, quemas cómputo y le das una ventana de feedback demasiado lenta para que se corrija. El otro extremo es peor: preguntarle a un LLM qué tests hay que correr no es una estrategia de verificación, es una apuesta con buena redacción. Determinista, por tanto.

Cambia también para qué sirve la suite. Un desarrollador ve un test en rojo y piensa que no tiene nada que ver con su cambio, y suele acertar porque arrastra contexto que la salida del test no contiene. Un agente no lo tiene salvo que se lo entregues explícitamente. Cuando recibe un conjunto concreto de tests válidos, se autocorrige e itera mejor. La suite deja de ser una puerta al final del proceso y pasa a ser la señal por la que el agente se guía: escribe, prueba, lee el resultado, corrige y vuelve a probar. Una suite lenta ya no molesta a una persona: frena un bucle autónomo. La latencia del feedback es una cifra de rendimiento, no de comodidad.

Tests generados y quién firma

Que la IA escriba tests rápido no arregla nada por sí solo. Veinte pruebas que cubren variaciones del mismo comportamiento y se dejan fuera el fallo que despierta a alguien a las dos de la mañana no son cobertura, son volumen. Decir que se han generado 5.000 tests más es una métrica horrible. Vale más preguntar qué riesgo cubren que antes no cubrían y si las aserciones significan algo o solo comprueban que una función devuelve algo. En el montaje de Anthropic los humanos siguen aprobando una parte importante de los PR: más automatización no ha reducido el control, ha subido el volumen que ese sistema de control tiene que tragar.

Lo que queda por ver es qué decisiones se mantienen deterministas y dónde sigue firmando una persona. El riesgo es el de siempre: sube el rendimiento de desarrollo, dirección decide enviar más, y la verificación no ha crecido al mismo ritmo. El resultado es más código, más tests generados, más trabajos de CI, una factura mayor y una confianza parecida.