OpenAI lanza GPT-6 Astra con precios altos y un despliegue accidentado
El nuevo modelo insignia promete ser el más capaz y alineado de la compañía, pero llega con retrasos, acceso desigual y dudas sobre sus benchmarks.

OpenAI ha lanzado GPT-6 Astra, su nuevo modelo insignia, y lo ha presentado como "el modelo más inteligente y más alineado hasta la fecha". La salida, en cambio, ha sido accidentada: retrasos, una entrada de blog que llegó tarde y usuarios de pago viendo cómo probadores e influencers entraban antes que ellos. El anuncio acumuló 36 millones de visualizaciones y 164.000 me gusta en nueve horas, el arranque con más repercusión de la compañía desde Sora.
El modelo se está desplegando primero a un grupo reducido de organizaciones y, a lo largo de varios días, a ChatGPT Plus, Pro, Business y Enterprise, además de la API y AWS. Como compensación por el tiempo sin acceso, OpenAI ha repartido lo que llama "banked resets", reinicios acumulados, por cada jornada en que los suscriptores de pago no han tenido Astra.
Precios y qué trae
La tarifa estándar es de 10 dólares por millón de tokens de entrada y 50 por millón de salida. Hay una variante rápida a 20 y 100 dólares por millón, con hasta 2,5 veces más velocidad. En producto, Codex puede hacer preguntas mientras sigue trabajando por su cuenta; hay una función experimental de contexto que deja al modelo tomar notas y buscar en ventanas de contexto anteriores durante tareas largas; y la API de Responses suma llamada a funciones asíncrona, dirección a mitad de turno y cambio del esfuerzo de razonamiento sin romper la caché.
Las cifras que da la compañía son altas: 99,9% en ARC-AGI-3, 98% en FrontierMath Tier 4, 100% en ExploitBench y 1,9 veces más rápido que GPT-5.6 Sol en Mind2Web con las mejoras del arnés de Codex. Son cifras suyas, no de un tercero.
El detalle incómodo
Ahí es donde el relato se complica. Artificial Analysis, que mide modelos de forma independiente, sitúa a Astra con 67 puntos en su Coding Agent Index, prácticamente empatado con Claude Opus 5 y Fable 5, mientras Fable 5.1 lidera con 70. En su índice de inteligencia, Astra saca 61: igual que GPT-5.6 Sol, cinco puntos por debajo de Fable 5.1 y por detrás de Muse Spark 1.3 de Meta.
La eficiencia es lo mejor de la comparativa. Gasta un 70% menos de tokens que GPT-5.6 Sol, un tercio de los que consume su predecesor en el arnés de Codex y una quinta parte de los de Claude Opus 5 en esfuerzo xhigh, con menos de la mitad del coste de Fable 5 para la misma puntuación. El problema está en el precio por token del extremo alto: usa un 10% menos de tokens de salida que GPT-5.6 Sol en esfuerzo máximo, pero cobra 2,5 veces más, lo que deja cada tarea un 75% más cara que la de su predecesor. En alucinación, la tasa cae del 92% al 51% en esfuerzo máximo y la precisión sube cuatro puntos.
Junto al modelo llegó la tarjeta de sistema. Describe mejoras de alineación, pero también una menor monitorabilidad de la cadena de razonamiento, y eso ha encendido a parte de la investigación en seguridad: varios nombres conocidos del área sostienen que el modelo parece consciente de estar siendo evaluado y que la ganancia visible en alineación puede estar tapando modos de fallo concretos en lugar de resolver el problema de fondo.
Queda por ver si el despliegue se normaliza y si los evaluadores independientes confirman el salto cuando las pruebas dejan de ser las que elige el fabricante.

