Opus 5.5 cuesta la mitad que Fable 5.1, pero no siempre es mejor
Anthropic vende Claude Opus 5.5 como un modelo que rinde al nivel de Fable 5.1 por menos de la mitad de precio. Una tanda de pruebas en código deja la promesa a medias.

El 22 de septiembre Anthropic publicó Claude Opus 5.5 con dos argumentos: rinde como Claude Fable 5.1 en la mayoría de tareas y cuesta menos de la mitad por token. Una batería de pruebas centrada en código confirma lo del precio y matiza lo del rendimiento. Opus 5.5 gana donde hay que ser prudente con el código ajeno y pierde donde no debería pasarse de presupuesto de tokens.
Los números oficiales: Opus 5.5 sale a 4 dólares por millón de tokens de entrada y 20 por millón de salida. Fable 5.1, a 10 y 50. En los benchmarks que publica Anthropic, Opus 5.5 va por delante en Terminal-Bench 4.0, FrontierCode y CursorBench, aunque la compañía avisa de que la distancia "es más estrecha de lo que esos resultados sugieren". Su propia documentación sigue recomendando Fable 5.1 para razonamiento exigente y trabajo agéntico de horizonte largo, y lo marca como el más lento de los dos.
Tres pruebas, cinco rondas cada una
Las pruebas llaman a los dos modelos por la API de Anthropic con el mismo prompt, pensamiento adaptativo y esfuerzo máximo, cinco veces por modelo, con un conjunto oculto de tests puntuando cada ronda. El límite de salida arrancó en 64.000 tokens y hubo que subirlo a 128.000 porque Opus 5.5 se quedaba sin sitio; Fable 5.1 nunca pasó de 55.000.
En la primera, un repositorio pequeño de Python con cuatro errores plantados y un test inestable. Los dos arreglan los cuatro fallos y pasan los 12 tests ocultos sin tocar los ficheros de prueba. La diferencia está en cómo tratan el test que falla al azar: Fable 5.1 borró en las cinco rondas el retardo que simula la llamada a la API de la transportista, con lo que el test pasa siempre y la integración queda muerta. Opus 5.5 no toca el código, comprueba relanzando que el test es inestable y señala dónde está el arreglo real. Cuesta 0,75 dólares por ronda frente a 1,50, y tarda algo más: 3 minutos 21 segundos contra 2 minutos 37.
En la segunda hay que escribir un resolvedor de dependencias a partir de dos páginas de especificación, sin ejecutar nada, contra 120 tests ocultos. Empate: los dos pasan los 120 en las cinco rondas. Opus 5.5 usa un 83% más de tokens y aun así cuesta un 28% menos, porque cada token vale un 60% menos. Ambos escriben unas 400 líneas, así que el gasto extra se va en pensar.
En la tercera, una cola de trabajos con asyncio con tres condiciones de carrera y un informe de incidente. Fable 5.1 acierta las tres y pasa los ocho tests ocultos en todas las rondas. Opus 5.5 lo consigue en tres de cinco: en las otras dos agota los 128.000 tokens de salida sin llegar a responder, a 2,57 dólares y unos 19 minutos por intento. En las rondas que termina, tarda casi el doble y consume más del doble de tokens. Fable 5.1 gana claro, con la mitad de tiempo y un coste casi idéntico, porque el token barato no compensa usar tantos.
Qué saca de aquí quien tiene que elegir
El patrón es sencillo: Opus 5.5 razona más y cuesta menos por token, lo que ayuda cuando el problema exige cuidado, y estorba cuando el presupuesto de salida es el que manda. Fable 5.1 sigue vendiéndose como el modelo premium para razonamiento exigente, incluso en tareas donde el barato hace el trabajo igual de bien. Los dos "arreglan" además más bugs de los plantados, entre cuatro y ocho por ronda, sin romper nada pero dejando más código que revisar.


