GPT-6 Sol es más rápido y barato que Opus 5.5, pero no repite sus aciertos
Cinco rondas por tarea dan 15 aciertos perfectos a Claude Opus 5.5 y 12 a GPT-6 Sol, con el modelo de OpenAI costando un sexto del total.

OpenAI lanzó GPT-6 Sol el 22 de septiembre con una promesa concreta: supera a Claude Opus 5 en tareas de flujo de trabajo empresarial a un 9% del coste por tarea. Sobre el papel, 33,2% en AutomationBench de Zapier frente al 26,9% de Opus 5, y a una fracción del precio. El detalle es que Anthropic sacó Opus 5.5 ese mismo día, y las pruebas contra el modelo nuevo cuentan otra cosa: Sol gana en velocidad y coste, pero Opus 5.5 es el que acierta siempre.
En tarifa, Sol se queda en 2 dólares por millón de tokens de entrada y 10 por millón de salida, la mitad que GPT-5.6 Sol. Opus 5.5 va a 4 y 20. El coste por tarea depende de cuántos tokens gaste cada uno, y ahí aparecen las sorpresas.
El test que los separa
Las pruebas habituales ya no distinguen a estos modelos. Con trabajo típico de desarrollador —arreglar tres bugs plantados en un servicio de facturación en Python, clasificar 40 trabajos de CI fallidos, responder 20 preguntas sobre un SDK falso sin inventarse métodos— ambos empataron. Con versiones más duras, un postmortem de 3.664 líneas y la implementación de una especificación evaluada por 120 tests ocultos, también. Así que la prueba se movió a la consistencia: cinco ejecuciones por test, las mismas prompts, vía API y al ajuste de esfuerzo máximo de cada uno. Los prompts no se han publicado porque cada test depende de archivos grandes.
En clasificación de CI, el escenario más parecido a lo que presume OpenAI, los dos hicieron 5 de 5 con las 40 llamadas correctas. Opus 5.5 tardó 1 minuto 27 segundos y gastó 0,24 dólares por ejecución; Sol, 18 segundos y 0,02. Eso es un 8% del coste, en línea con el 9% que anuncia el fabricante. La razón de que Opus 5.5 salga caro por tarea pese a ser más barato por token es que consume casi cuatro veces más tokens de salida.
En logs de incidentes, Opus 5.5 clavó las cinco rondas. Sol solo dos. Una ejecución dejó fuera a un cliente cuyo cargo se confirmó 52 segundos después de que el reintento ya hubiera funcionado; otra contó 27 checkouts fallidos en lugar de 28. En la especificación del resolver, Opus 5.5 pasó las cinco y Sol pasó cuatro: en la quinta dejó un paréntesis de cierre suelto en la línea 78, el módulo reventó al importarse y cayeron los 120 tests.
El balance
Quince rondas perfectas para Opus 5.5, doce para Sol, con los tres fallos concentrados en los dos tests más difíciles. El coste total: 16,72 dólares frente a 2,68, aproximadamente un sexto. Sol fue además más rápido en todo, hasta casi cinco veces en la clasificación de CI.
La lectura operativa es la de siempre con los modelos baratos: Sol encaja en trabajo de alto volumen donde una persona o una suite de tests valida la salida —triaje, borradores, código que pasa por CI—. Sus fallos, en cambio, son justo los que se cuelan en una revisión: un cliente que falta en una lista de reembolsos, un archivo que no importa.


