Claude Opus 5.5 es más barato y más rápido que Opus 5, pero no razona mejor
Anthropic promete un 40% menos de coste y un 30% más de velocidad. Tres pruebas de razonamiento confirman el ahorro, rebajan la velocidad al 11% y dejan el empate en aciertos.

Anthropic presentó esta semana Claude Opus 5.5 con tres promesas: rinde al nivel de Claude Fable 5.1, cuesta un 40% menos que Opus 5 y genera salida más de un 30% más rápido. Un repaso independiente a tres problemas de razonamiento deja la factura más baja confirmada y las otras dos afirmaciones en el aire: ambos modelos aciertan y fallan exactamente lo mismo, y la mejora de velocidad medida es del 11%, no del 30%.
La compañía también ha recortado el precio del API. Opus 5.5 cuesta 4 dólares por cada millón de tokens de entrada y 20 por cada millón de salida, frente a los 5 y 25 de Opus 5. Ese recorte, por sí solo, explica un 20% de ahorro; el otro 20% hasta llegar al 40% prometido tiene que salir de que el modelo gaste menos tokens.
Qué se probó
Las pruebas se hicieron llamando a los dos modelos por el API con los mismos prompts, con pensamiento adaptativo en el nivel de esfuerzo por defecto (Opus 5.5 no permite desactivarlo). Se registraron tokens de entrada y salida, coste a precio de tarifa y tiempo de cada llamada. Los tokens de pensamiento se facturan como salida, así que entran en la cuenta.
Tres ejercicios. Una rejilla lógica de dificultad media con siete ingenieros, 22 pistas y seis condiciones cruzadas. Un problema de ordenación: recolocar 10 tareas de despliegue sin que ninguna quede en su posición original ni dos consecutivas queden juntas, dando el recuento para 6, 8 y 10 tareas. Y un juego de piedras con memoria, donde los jugadores retiran 2, 5, 7 u 11 piedras sin repetir la jugada anterior.
En la rejilla lógica ambos modelos acertaron las 28 casillas. Opus 5.5 tardó 65 segundos y gastó 7.573 tokens de salida, 0,16 dólares. Opus 5 tardó 108 segundos, gastó 10.621 tokens y costó 0,27. Mismo resultado, un 43% más barato.
En la ordenación no respondió ninguno. Con el límite de salida en 48.000 tokens, los dos se comieron el presupuesto pensando y no llegaron a contestar; Opus 5.5 costó 0,96 dólares y Opus 5, 1,20. Subiendo el límite a 128.000, Opus 5 agotó los tokens, pasó de 25 minutos y se quedó sin respuesta por 3,20 dólares. Opus 5.5 corrió 19 minutos, usó 112.733 tokens y el API cerró la respuesta con un motivo de parada de rechazo, sin texto. El prompt solo pide contar ordenaciones, así que el filtro de seguridad de Anthropic parece haber saltado por error.
El juego de piedras volvió a empatar: los dos acertaron las tres partes. Aquí la diferencia estuvo en el esfuerzo. Opus 5.5 terminó en 215 segundos con 28.740 tokens de salida y 0,58 dólares; Opus 5 necesitó 624 segundos, 74.981 tokens y 1,88 dólares. Un 62% menos de tokens y un 69% menos de coste para la misma respuesta.
Los totales
Sumando todas las llamadas, Opus 5.5 escribió 197.046 tokens de salida en 31 minutos y 45 segundos por 3,95 dólares. Opus 5, 261.602 tokens en 46 minutos y 49 segundos por 6,55. El gasto conjunto de la prueba fue de 10,50 dólares. La velocidad de escritura quedó en 103,4 tokens por segundo frente a 93,1, un 11% mejor; el mayor margen en un solo problema fue del 19%.
El ahorro es real y la velocidad también, aunque más pequeña de lo anunciado. Quien ya corra Opus 5 tiene motivo para cambiar de versión: mismo acierto, factura más corta. Quien espere un salto de capacidad en razonamiento no lo va a encontrar en estos tres ejercicios, y el falso positivo del filtro en una tarea inocua es lo que conviene vigilar antes de meterlo en un pipeline sin supervisión.

