Claude Fable 5.1 no supera a su predecesor en pruebas de trabajo real
Una comparativa independiente muestra que las mejoras de rendimiento en benchmarks no se trasladan a tareas de codificación y análisis habituales.

Anthropic ha lanzado Claude Fable 5.1, presentándolo como su modelo más avanzado para programación y trabajo de conocimiento. La compañía subraya una mejora sustancial en el benchmark Terminal-Bench-Science, donde el nuevo modelo obtiene un 52,6% frente al 24,7% de la versión 5. Sin embargo, una prueba independiente realizada por The New Stack sugiere que esta diferencia no se percibe en el uso diario.
La brecha entre el benchmark y la práctica
El autor de la prueba sometió ambos modelos a cuatro tareas que imitan el trabajo real de un desarrollador o analista: investigación agentica, depuración de código, razonamiento matemático y auditoría de datos de sensores. En todas las pruebas de precisión, ambos modelos lograron un resultado perfecto de 24 sobre 24 puntos.
En las tareas de investigación y codificación, la versión 5.1 resultó ligeramente más rápida y estableció un menor coste por ejecución. Por ejemplo, en la prueba de depuración, Fable 5.1 tardó 13,6 segundos frente a los 17,2 de la versión anterior, con un coste idéntico de 0,07 dólares. En razonamiento, el nuevo modelo fue más conciso, utilizando menos tokens de salida para llegar a la misma respuesta correcta.
La sorpresa llegó en la auditoría de datos, la tarea diseñada como más compleja. Aquí, Fable 5 superó a su sucesor. El modelo anterior completó la tarea en 4 turnos, 23,9 segundos y 0,134 dólares. La versión 5.1 necesitó 5 turnos, 28,4 segundos y 0,304 dólares. Esta diferencia se debe a que cada turno reenvía la conversación completa, generando un consumo de tokens de entrada disparado (23.602 frente a 7.940) que duplica el coste final.
Implicaciones para el despliegue
Los precios de API se mantienen sin cambios: 10 dólares por millón de tokens de entrada y 50 por millón de salida. Aunque la versión 5.1 ganó en velocidad global (82,9 segundos frente a 84,9 en el total de la prueba), consumió un 70% más de tokens y costó un 34% más que la versión 5.
Esto plantea una duda operativa para quienes gestionan costes en la nube. Si el beneficio principal del 5.1 se limita a tareas de investigación científica muy largas y desordenadas, tal vez no justifique la migración para equipos que ejecutan scripts de mantenimiento, corrección de errores o análisis de datos estructurados. La lección es clara: los benchmarks de marketing pueden sobrevalorar la ganancia real. Antes de actualizar, conviene validar el rendimiento con los propios casos de uso de la organización, especialmente si la optimización de costes es prioritaria.

