BookinglyTech News
Inteligencia artificial

Claude Opus 5.5 permite terminar tareas de código completas y reduce costos

Anthropic lanzó Claude Opus 5.5, un modelo que cubre todo el ciclo de desarrollo y cuesta un 40 % menos que su predecesor Opus 5.

2 min de lecturaThe New Stack0 vistas

Anthropic presentó el martes Claude Opus 5.5, la primera versión de la familia Claude 5.5 pensada para cubrir todo el ciclo de vida del software: generación de especificaciones, depuración, generación de código, pruebas y auditorías. Según la compañía, el modelo ofrece el mismo nivel de rendimiento que Claude Fable 5.1 en la mayor parte de las tareas y reduce aproximadamente un 40 % el coste de ejecución frente a Opus 5.

Mario Rodriguez, chief product officer de GitHub, destacó que Opus 5.5 consume menos tokens y pasos en entornos como el CLI de Copilot y VS Code. En pruebas internas, el modelo resolvió más tareas de terminal con menos de la mitad de los pasos que Opus 5, lo que, según él, permite que los proyectos más grandes sean factibles.

Anthropic atribuye estas mejoras a un proceso de alineación ampliado, que incluye pruebas exhaustivas de alineación, evaluación externa previa al lanzamiento y salvaguardas específicas para áreas de alto riesgo como ciberseguridad y biología. En su prueba de alineación más completa, Opus 5.5 fue el modelo con mejor desempeño, reduciendo comportamientos problemáticos como razonamiento sesgado o intentos de escapar de sandbox.

Akash Thakur, arquitecto de confiabilidad de SRE y IA, reconoce el avance en la capacidad de completar tareas, pero advierte que el verdadero desafío es saber cuándo el modelo no ha terminado correctamente. "Los modelos pueden dividir un proyecto en piezas pequeñas, pero 'completado' no siempre equivale a 'correcto'", señaló.

En un caso de prueba interno, Opus 5.5 migró y auditó un código de 200 000 líneas en menos de tres horas, frente a más de 20 horas de Opus 5 y con 2,5 veces menos de tokens. Otro experimento tradujo HAProxy de C a Rust en 9,5 horas, un 21 % menos de tiempo que Fable 5.1 y con un 51 % menos de coste.

El CTO de Coder para EMEA, Eric Paulsen, recuerda que la capacidad de automatizar todo el flujo de entrega de software plantea requisitos de infraestructura gobernada, con guardrails, manejo de secretos y observabilidad equivalentes a los de cualquier carga de trabajo de producción.

Anthropic también anunció programas de verificación para biología y ciberseguridad, y asegura que los modelos de respaldo (Opus 4.8 o Opus 5) entrarán en juego cuando se activen salvaguardas. La empresa menciona su colaboración con Accenture para crear un equipo de evaluadores integrados que reforzará la seguridad de futuros lanzamientos.

Implicaciones: Opus 5.5 muestra que los LLM pueden asumir tareas de código de extremo a extremo, pero su adopción requerirá entornos controlados y procesos de validación para evitar errores ocultos que podrían costar más a los equipos de desarrollo.