Claude Fable 5.1 y 5: Benchmark de Terminal-Bench-Science en entorno real
Anthropic presentó la mejora de Fable 5.1 con un doble rendimiento frente a Fable 5 en Terminal-Bench-Science, pero la diferencia se reduce cuando el modelo corre en condiciones de usuarios promedio.

Cuando Anthropic lanzó Claude Fable 5.1 este mes, el anuncio giró en torno a un solo resultado de benchmark: su puntaje Terminal‑Bench‑Science. En ese test, el modelo debe resolver un problema científico real de forma autónoma. Fable 5.1 marca 52.6 %, mientras que Fable 5 solo consigue 24.7 %. La puntuación fue obtenida con condiciones de laboratorio: ocho horas por tarea y un presupuesto no revelado.
Para entender lo que un usuario medio puede esperar, se probaron cinco tareas públicas de Terminal‑Bench‑Science (símbolo‑regresión, Lorenz‑96, control de reactor, modelo cognitivo y nanoindentación) con un límite de 12 USD y 60 turnos. El experimento total duró unas 12 horas y generó 430 k tokens de salida y 53.6 USD de costo con Fable 5, y 456 k tokens y 40.8 USD con Fable 5.1.
Resultados clave
- Símbolo‑regresión: Fable 5.1 pasa la prueba en 11.8 min, 27 088 tokens y 1.96 USD, mientras que Fable 5 falla tras 60 turnos y 4.20 USD.
- Lorenz‑96: Fable 5.1 consume 10.70 USD en 126 min, 89 789 tokens; Fable 5 alcanza el límite de 12 USD en 45 turnos y 92 091 tokens.
- Control de reactor: Ninguno escribe un controlador funcional; Fable 5.1 genera 157 710 tokens y gasta 11.53 USD.
- Modelo cognitivo: Solo Fable 5.1 declara finalizado en 53.5 min con 65 518 tokens, pero el calificador lo rechaza.
- Nanoindentación: Ambos fallan, con costos de 10.91 USD y 12.59 USD respectivamente.
En la tabla de resultados: Fable 5 resuelve 0 de 5 tareas, Fable 5.1 solo 1 de 5. El total de tokens y costos son menores para el 5.1, y solo cuatro ejecuciones de 5 alcanzan el límite de gasto.
Los puntajes publicados por Anthropic provienen de 210 intentos con un gasto de 14 180 USD. En la tabla pública del leaderboard, Fable 5 obtiene 21.4 % (cerca de los 24.7 %). Fable 5.1 todavía no aparece allí, por lo que el 52.6 % es exclusivo de la empresa.
Implicaciones Para un operador de laboratorio o un desarrollador que usa Fable sin un harness especializado, la mejora del 5.1 se traduce en costos más bajos y tiempos de ejecución más cortos, pero el salto de rendimiento real es marginal. La diferencia más visible es la reducción de costos por tarea, lo que puede ser relevante cuando se escala el uso.
El benchmark sugiere que, con un harness optimizado y un presupuesto mayor, la brecha entre 5 y 5.1 se ampliaría, pero para la mayoría de los casos de uso cotidianos la ventaja es modesta.
Enlaces útiles
- El repositorio del benchmark público: Terminal‑Bench‑Science
- Noticias y actualizaciones sobre el benchmark: Terminal‑Bench‑Science 0.1

