GPT-6 Astra supera a GPT-5.6 en generación de SVGs, según prueba práctica
Simon Willison ha publicado una comparativa visual generando pelícanos en bicicleta con varios modelos de OpenAI. Astra rinde mejor que Sol en cualquier nivel de razonamiento, con menos tokens y a menor coste por resultado útil.

Simon Willison ha tenido acceso a GPT-6 Astra y, como hace con cada modelo nuevo, lo ha puesto a prueba con una tarea concreta: generar SVGs de pelícanos montando bicicletas. Ha usado los niveles de razonamiento bajo, medio, alto, muy alto y máximo (Astra no soporta el modo sin razonamiento) y ha comparado los resultados con GPT-5.6 Sol, Terra y Luna en una cuadrícula.
Lo que demuestra no es solo que el modelo produce imágenes más reconocibles, sino que la mejora se nota incluso en el nivel más bajo. Según el análisis de Willison, el mejor pelícano de Sol (que a su juicio es el de nivel xhigh, no el de max) sigue siendo un conjunto de formas abstractas, mientras que todos los de Astra, del bajo al xhigh, se ven mejor. El de Astra a nivel máximo es realmente bueno, aunque por debajo de máx aún falla en poner las patas del pelícano a ambos lados del encuadre.
Lo más interesante para quien pague tokens es la relación calidad-precio. Astra cuesta el doble por token que Sol (10 $/millón de entrada y 50 $/millón de salida, frente a 5 $/30 $), pero consume significativamente menos tokens en cada nivel. El resultado: a nivel bajo, Astra produce un pelícano mejor que cualquiera de los de Sol a cualquier nivel, por unos 9,55 centavos. Es decir, gastar 10 centavos en otro modelo da bastante peor resultado.
Willison también señala un detalle curioso: los contadores de tokens de entrada muestran que Astra y Luna consumieron 16 tokens, mientras que Sol y Terra gastaron 26. Eso le hace sospechar que Astra y Luna comparten más arquitectura de lo que OpenAI ha reconocido oficialmente.
La comparativa completa, con las imágenes en alta calidad, está en la cuadrícula, y el transcript de la conversación con el modelo que generó los pelícanos de Astra está reproducido en este renderizador de markdown.
La prueba no es exhaustiva ni pretende medir capacidades generales, pero sí aporta datos útiles para quien esté evaluando qué modelo usar en tareas de generación gráfica asistida por IA: si la calidad mínima aceptable la da Astra a nivel bajo, el coste por resultado útil puede ser menor que recurrir a Sol incluso con su precio de token más bajo. Y la diferencia de tokens de entrada sugiere que la familia Astra (y quizá Luna) maneja de forma más eficiente el contexto, algo relevante para quienes integren estos modelos en pipelines con muchas llamadas.


