BookinglyTech News
Inteligencia artificial

Cognition usa GPT-6 Astra para que Devin pruebe y documente su propio codigo

La firma aplica el modelo de OpenAI en toda su linea de producto para que el agente genere grabaciones y reportes que evidencien que el codigo funciona, y asi reducir la revision manual.

2 min de lecturaOpenAI0 vistas

Cognition ha empezado a usar GPT-6 Astra, el modelo de OpenAI, en toda su familia de productos. El objetivo: que Devin, su ingeniero de software autonomo, no solo escriba codigo, sino que lo pruebe y ensene las pruebas. La compania quiere reducir asi la revision manual que hoy consume a sus equipos de ingenieria.

Walden Yan, cofundador de Cognition, situa ahi la mejora principal de Astra: en su capacidad de probar y demostrar que el trabajo funciona como se espera, no solo de afirmarlo.

Grabaciones y reportes en lugar de inspeccion a ojo

El ejemplo que dan es concreto. Devin usa Astra para probar Otter Run, un juego de iPhone. El resultado es una grabacion del juego corriendo en un simulador y un informe que separa las comprobaciones que han pasado de las areas que quedaron sin cubrir. La grabacion documenta el comportamiento; el informe, el alcance de lo probado. Un ingeniero puede mirar ambos y decidir que falta.

El modelo tambien se aplica fuera del agente principal. Yan dice que lo usan tanto en el agente cloud que es Devin como en su CLI y sus productos de escritorio. En atencion al cliente el efecto es mas inmediato: si un cliente manda una captura de pantalla con un fallo, el equipo se la pasa a Devin con Astra, que arregla el problema y devuelve otra captura con el resultado. La compania sostiene que eso les permite responder mucho mas rapido.

La revision manual como cuello de botella

El argumento de fondo es economico. A medida que los equipos de Cognition escriben mas codigo, revisarlo se convierte en el cuello de botella. Si Devin prueba su propio trabajo y aporta pruebas, el ingeniero examina menos lineas a mano. Yan lo plantea como expectativa, no como resultado medido: esperan mirar menos codigo a mano y enviar mas con el tiempo, y dice que es una de las cosas que mas les entusiasma de GPT-6.

No hay cifras. Cognition no ha publicado cuantas revisiones ha eliminado ni cuanto tiempo ahorra, y OpenAI tampoco da datos de rendimiento del modelo en estas tareas. Todo lo que hay son ejemplos cualitativos y declaraciones de un cofundador interesado en que su producto parezca mejor.

Para quien administra equipos de desarrollo, la pregunta practica sigue abierta: si el agente se aprueba a si mismo, quien audita al agente. La respuesta que insinuan son el informe y la grabacion, que dejan rastro. Habra que ver si esos artefactos aguantan una revision seria cuando el codigo toca produccion y no un juego de iPhone.