BookinglyTech News
Inteligencia artificial

Anthropic lanza Opus 5.5 con un 20% de descuento y una pegadilla en agentes

El nuevo modelo de Anthropic es más barato y rápido, pero los clasificadores de seguridad pueden redirigir peticiones a versiones anteriores sin avisar.

2 min de lecturaThe New Stack0 vistas

Anthropic ha lanzado Claude Opus 5.5, un nuevo modelo de lenguaje que reduce los costes por un 20% respecto a la versión anterior y mejora las métricas de rendimiento en tareas agénticas. La compañía fija el precio en 4 dólares por millón de tokens de entrada y 20 dólares por millón de salida, una baja significativa si se considera que el modelo es más eficiente en el uso de tokens y genera la salida un 30% más rápido.

Eficacia y costes en escenarios de producción

Los datos tempranos sugieren que la mejora en eficiencia es tangible. Box reportó que Opus 5.5 usaba un tercio de los tokens de Opus 5 en sus evaluaciones, produciendo respuestas un 40% menos verbosas sin perder precisión. GitHub, que probó el modelo en Copilot CLI y VS Code, encontró que completaba más tareas en la terminal en menos de la mitad de los pasos. Deloitte señaló que la configuración de menor esfuerzo capturó el 72% de los bugs conocidos en revisiones de código, frente al 56% de Opus 5 en su configuración de alto esfuerzo.

En benchmarks de codificación agéntica, Opus 5.5 lidera con un 66,4% en Terminal-Bench 4.0, superando al Fable 5.1 (55,8%) y al GPT-6 Astra (57,9%). Aunque Anthropic advierte que pocas puntos porcentuales en benchmarks no siempre se traducen a diferencias notables en uso real, la diferencia de coste es el factor que podría cambiar la ecuación económica para muchas organizaciones. Opus 5.5 cuesta más de la mitad que Fable 5.1 y alrededor del 20% del coste por tarea de GPT-6 Astra en FrontierCode.

El problema de los redirigimientos de seguridad

El detalle técnico más relevante para arquitectos de sistemas reside en los clasificadores de seguridad. Opus 5.5 incorpora los mismos filtros que Fable 5.1 para ciberseguridad, biología y desarrollo de LLMs fronterizos. Cuando un clasificador se activa, Anthropic redirige la petición de manera transparente a un modelo anterior, ya sea Opus 4.8 o Opus 5.

Para quien construye flujos de trabajo agénticos multi-turno, esto implica una inconsistencia potencial: una petición enviada a Opus 5.5 podría ser atendida por un modelo con capacidades diferentes. Esto puede afectar a los pasos downstream del pipeline y crear inconsistencias que no aparezcan en evaluaciones diseñadas bajo el supuesto de que todas las peticiones van al mismo modelo. Anthropic ofrece un programa de verificación para organizaciones de ciencias de la vida que deseen usar el modelo sin el clasificador biológico, y planea expandir su programa de ciberseguridad próximamente.

La eficiencia en tokens y la reducción de pasos son bienvenidas, pero los equipos que desplieguen agentes de producción deben tener en cuenta este comportamiento de redirección al diseñar sus capas de orquestación y observabilidad.