BookinglyTech News
Inteligencia artificial

GPT-6 Astra llega al frente de los benchmarks y reabre el debate del razonamiento oculto

Astra encabeza los índices independientes de Artificial Analysis y arrasa en ARC-AGI-3, aunque su ventaja en código es menor de lo que parece. Circulan rumores de que oculta su traza de razonamiento.

3 min de lecturaHacker News (top)0 vistas

OpenAI publicó GPT-6 Astra la semana pasada y las primeras pruebas lo colocan por delante de GPT-5.6 Sol en prácticamente todas las categorías, con una ventaja que se agranda en todo lo gráfico: renderizado 3D, animación y tareas que pasan por manejar interfaces. Sobre la mesa hay además dos asuntos menos comerciales: los rumores de que el modelo esconde su cadena de razonamiento y el papel que juega la profundidad recurrente, los llamados transformers con bucle.

Los números y el arnés

En ARC-AGI-3, el benchmark que mezcla puzles lógicos y generalización, Astra se anota un 99,9% frente al 7,8% de su predecesor. Es la cifra que más suena, aunque la lectura interesante está en los índices de Artificial Analysis, independientes y por tanto algo más fiables que las evaluaciones que publica el propio desarrollador. En el Coding Agent Index v1.4 Astra está en la frontera, pero no se despega por goleada; lo mismo en el Intelligence Index v4.2, que mezcla tareas de varios tipos.

Ahí entra el arnés. GDPval-AA y AA-Briefcase usan Stirrup, el arnés mínimo y open source de Artificial Analysis; Terminal-Bench 2.1 corre sobre Terminus 2 y τ³-Banking sobre el arnés de τ-Bench. Cuando el arnés es compartido, la comparación es más justa. El problema es que cada modelo se entrena pensando en un arnés principal, afinado para explotar sus puntos fuertes, así que las evaluaciones agénticas pueden quedarse cortas respecto a lo que el modelo hace en su entorno habitual.

De propina, un consejo que va contra la inercia: revisar, archivar o regenerar los AGENTS.md y los SKILL.md. Los modelos nuevos entienden mejor el prompt y el exceso de instrucciones los encorseta. No se trata de borrarlos siempre —siguen sirviendo cuando evitan que el modelo redescubra algo—, pero las descripciones viejas ya no son las óptimas.

Uso del ordenador y trazas ocultas

Lo que más se comparte en redes son las demos de computer use: Astra maneja el ratón y el software del equipo a través de Codex o de la aplicación de ChatGPT. Modelar Nueva York en Blender, recorrer una casa virtual o rehacer un dibujo en una versión de MS Paint para navegador con el cursor. No es la primera familia de modelos capaz de operar una interfaz dentro de un arnés, pero sigue siendo una capacidad joven y menos madura que escribir texto, programar o llamar a una API.

El otro frente es el que más ruido genera: la sospecha de que Astra no muestra su traza de razonamiento y su posible relación con los transformers con bucle. Ese detalle de diseño —repetir bloques para ganar profundidad efectiva sin multiplicar parámetros— sostiene la hipótesis, y también alimenta las dudas de seguridad que ya se han publicado al respecto.

Para quien despliega y mantiene sistemas, la parte relevante no es el ranking. Si un modelo no expone su razonamiento, auditar por qué acierta o falla en tareas de código y de operación se vuelve más caro, y la ventaja en los benchmarks no compensa esa pérdida de trazabilidad. Queda por ver si lo de Astra es una consecuencia del diseño recurrente o solo una decisión de producto.