BookinglyTech News
Inteligencia artificial

Sonnet 5.5 supera a Opus 5.5 en Terminal‑Bench y el precio sigue igual

Anthropic lanzó Sonnet 5.5 el 28 septiembre a $2/$10 por millón de tokens, y el modelo de gama media gana el benchmark de terminales con un 4,2 puntos sobre Opus 5.5, a pesar de ser más caro por token.

2 min de lecturaDev.to0 vistas

Anthropic publicó Claude Sonnet 5.5 el 28 septiembre, a $2 / $10 por millón de tokens, igual que su predecesor Opus 5.5. La diferencia es que Sonnet 5.5 alcanza un 70,6 % en Terminal‑Bench 4.0, mientras que Opus 5.5 queda en 66,4 %—una brecha de 4,2 puntos.

Los datos de la tabla oficial de Anthropic muestran que la mayoría de los benchmarks están separados por márgenes de un solo dígito. En FrontierCode 1.1, Opus lidera 8,2 puntos; en CursorBench 4.0, Opus gana 2,3 puntos; en GDPval‑AA v2.1, la diferencia es de 2 puntos sobre 1 846.

En cuanto al coste, Sonnet 5.5 cuesta el doble por token en entradas y salidas, pero la lectura de caché es idéntica. Cuando se mide en “Max effort”, Sonnet 5.5 requiere más tokens, lo que eleva su coste a aproximadamente $7,60 por tarea. En “Xhigh effort”, Opus 5.5 iguala el puntaje máximo de Sonnet 5.5 a solo $3,46 por tarea.

Los benchmarks de CodeRabbit revelan que, en 44 pull requests, Sonnet 5.5 tarda 6 min 33 s por revisión, al contrario de 13 min 31 s para Sonnet 5.0, duplicando la velocidad y reduciendo el coste en flujos de trabajo agentes.

La discusión en Hacker News gira en torno a la “cannibalización” del precio y la estrategia de effort: un usuario señala que Opus a bajo esfuerzo es más barato y rápido que Sonnet en medio, mientras que otro comenta que los LLMs todavía cometen errores de diseño fundamental.

En la semana previa a la publicación, Anthropic redujo el precio de Opus 5.5 en un 20 % y OpenAI lanzó GPT‑6 Sol a $2 / $10, creando una guerra de precios de modelos de frontera. Fortune describió la situación como una “price war” a pesar de las llamadas de la industria a la ralentización.

En resumen, Sonnet 5.5 demuestra mejoras significativas en benchmarks de terminales y revisión de código, pero su precio por token y la necesidad de mayor esfuerzo para alcanzar el máximo rendimiento deben ser considerados al decidir la arquitectura de la API.

Repositorio oficial de Anthropic