BookinglyTech News
Inteligencia artificial

GPT-6 Astra: 2,5 veces más caro por token, pero con ajuste bajo supera a GPT-5.6 Sol en alto

OpenAI defiende que su nuevo modelo GPT-6 Astra, pese a costar 2,5 veces más por token que GPT-5.6 Sol, puede resultar más barato por tarea con el ajuste de razonamiento bajo, y añade un mecanismo para cambiar sobre la marcha.

3 min de lecturaThe New Stack0 vistas

OpenAI ha publicado datos con los que intenta que los desarrolladores no miren solo el precio por token de su nuevo GPT-6 Astra, que cuesta 2,5 veces más que el GPT-5.6 Sol: $10 por millón de tokens de entrada y $50 por millón de salida frente a $4 y $20. La compañía sostiene que, con el ajuste de razonamiento bajo, Astra rinde mejor que Sol con el ajuste alto: Artificial Analysis lo puntúa con 49 en su Índice de Inteligencia, frente a los 48 de Sol-high, y además el primer token llega en 2,53 segundos en lugar de 11,87. La idea que OpenAI quiere vender es que el precio por token no dice nada del coste económico de una tarea.

Más caro por token, más barato por tarea

Según la guía de migración, Astra produce resultados más sólidos consumiendo muchos menos tokens de salida. En sus pruebas con Terminal-Bench 4.0, Astra llega al 57,9% de éxito frente al 37,3% de Sol, pero con un coste estimado por tarea un 9% menor. En GPQA Diamond, la ventaja en precisión es menor (94,9% frente a 94,6%), pero el coste baja un 37%. OpenAI menciona que está explorando modelos de precio basados en el resultado, no en el token.

Un desarrollador identificado como Shinpr comparó ambos modelos sobre un mismo código, con fases de análisis, implementación y revisión, y documentó los resultados en una entrada de blog. Con el nivel medium de Astra, la implementación se resolvió en 80 peticiones, frente a las 238 que necesitó Sol-high, y procesó 11,1 millones de tokens de entrada en lugar de 37,8 millones. La ejecución completa con Astra-medium tardó unos 51 minutos y costó unos 25,67 dólares; Sol-high tardó 75 minutos y costó 31,79 dólares. Subir Astra a high no solo no ayudó: la prueba se alargó a 77 minutos y 37,23 dólares, y en la revisión se le escapó un bug de arranque que medium había detectado. No valdrá para todos los casos, pero indica que a menudo el razonamiento extra no se paga solo.

Sin embargo, no siempre. Las pruebas de ARC Prize con el benchmark ARC-AGI-3 muestran la tendencia inversa. Más razonamiento no solo mejoró la puntuación de Astra (del 17,5% en low al 62,7% en max), sino que en algunos casos redujo el coste del experimento. Con su entorno estándar, ARC Prize gastó 38.166 dólares con low, 48.090 con medium y 40.705 con high; con max, el coste bajó a 26.098 dólares. El motivo es que, con más razonamiento por decisión, el modelo necesitó menos acciones para completar los entornos, y eso compensó el mayor coste de cómputo.

Razonamiento dinámico sin perder caché

Para que el desarrollador no tenga que fijar un nivel para todo el flujo, Astra incorpora un mecanismo llamado configuration_update, que permite variar el esfuerzo de razonamiento entre una respuesta y la siguiente sin alterar la configuración original de la petición ni perder la caché. De este modo, el trabajo rutinario puede seguir en low, y una prueba que falla, una respuesta de herramienta inesperada o un problema de depuración complicado pueden disparar un nivel mayor en el siguiente turno, y bajar cuando se resuelve.

Ese mecanismo ayuda a entender por qué Shinpr y ARC Prize llegaron a conclusiones opuestas. En un caso, el razonamiento extra solo añadió tiempo y dinero; en el otro, redujo las llamadas necesarias. El coste óptimo no depende de la tarifa del token, sino de cuántos intentos hacen falta para completar la tarea. Un modelo que cuesta más por token puede ser el más barato si necesita menos llamadas para hacer bien el trabajo.