BookinglyTech News
Inteligencia artificial

OpenAI vende Astra pero no el sistema que marcó 98,6 % en ARC‑AGI‑3

OpenAI ofrece el modelo GPT‑6 Astra con su propio adaptador de proveedor, pero el rendimiento de 98,6 % sobre el benchmark ARC‑AGI‑3 se logró con la infraestructura de ARC Prize, no con el modelo en sí.

2 min de lecturaThe New Stack0 vistas

La diferencia entre modelo y harness

OpenAI ha puesto a disposición de los clientes el modelo GPT‑6 Astra, pero la cifra de 98,6 % que aparece en el benchmark ARC‑AGI‑3 se consiguió gracias a la harness de ARC Prize, no al modelo en sí. La misma arquitectura de modelo, cuando se ejecuta dentro del Provider Adapter de OpenAI, alcanza 98,6 % con un coste de 17 332 USD, frente a 62,7 % y 26 098 USD con la harness estándar de ARC Prize.

Métricas de rendimiento y coste

  • Maximo: 62,7 % (26 098 USD) vs 98,6 % (17 332 USD)
  • High: 54,8 % (40 705 USD) vs 99,9 % (18 817 USD)
  • Medium: 38,6 % (48 090 USD) vs 98,4 % (19 285 USD)
  • Low: 17,5 % (38 166 USD) vs 98,0 % (21 298 USD)
  • None: 35,2 % (49 791 USD) vs 96,7 % (23 457 USD)

El adaptador de OpenAI mantiene el estado de razonamiento entre peticiones y comprime conversaciones largas, lo que permite que el modelo retome su propio razonamiento en lugar de reconstruirlo. ARC Prize, en cambio, permite al modelo conservar notas que elija mantener.

Impacto en tokens y velocidad

En los 167 pares de juego‑razonamiento, la harness de OpenAI reduce el número de tokens en un 49 % y acelera la ejecución en un 3,66‑vez respecto a ARC Prize. La reducción de tokens y la mayor velocidad implican un coste operativo menor.

El valor del harness como producto

Los principales actores de IA –Anthropic, OpenAI, Google y Microsoft– ya están comercializando la harness como un producto independiente. Anthropic cobra 0,08 USD por hora de sesión, Google y Microsoft desglosan el coste en sesiones, memoria, ejecución de código y observabilidad, mientras que OpenAI ofrece el SDK sin tarifa de ejecución.

El debate no se centra en el modelo en sí, sino en la infraestructura que lo hace funcionar. El benchmark no prueba que el modelo sea AGI, sino que demuestra cómo la harness puede transformar el rendimiento y el coste.

Perspectivas para la industria

La tendencia es clara: la ingeniería de harness se está convirtiendo en un factor decisivo para la adopción de modelos de IA. Empresas que invierten en capas de abstracción, memoria persistente y supervisión programática están ganando ventaja competitiva.

Para los administradores de sistemas y arquitectos, esto significa que la selección de un modelo debe ir acompañada de una evaluación exhaustiva de la harness disponible. La decisión de comprar un modelo no basta; también hay que decidir si se va a integrar con un adaptador propio o con la harness de un proveedor.

En conclusión, el éxito de GPT‑6 Astra en ARC‑AGI‑3 demuestra que el rendimiento de los modelos de IA depende tanto del algoritmo como de la ingeniería del entorno que lo rodea. Los que quieran aprovechar al máximo estas tecnologías deberán mirar más allá del modelo y considerar la harness como un activo crítico.