BookinglyTech News
Inteligencia artificial

Fable 5.1 lidera Real-SWE en código empresarial, pero cuesta casi el triple que Gemini 3.8 Flash

El benchmark de Specific Labs mide agentes sobre repositorios privados de empresas: Fable 5.1 en Claude Code gana con un 38,8% de tareas resueltas y 6,96 dólares por ejecución.

3 min de lecturaDev.to0 vistas

Specific Labs ha publicado Real-SWE, un banco de pruebas que evalúa agentes de código sobre repositorios privados de empresas en producción en lugar de proyectos públicos. La mejor configuración es Fable 5.1 dentro de Claude Code, con un 38,8% de tareas resueltas al primer intento, y también es la más cara de las medidas: 6,96 dólares por ejecución estimados.

Por detrás quedan GPT-6 Astra en Codex CLI, con 33,8% y 4,67 dólares, y Gemini 3.8 Flash en Gemini CLI, que con un 31,2% es la opción barata a 2,50 dólares. Después aparecen GLM 5.3 en Claude Code (28,8%, 5,12 dólares), Grok 4.6 en Grok Build y Muse Spark 1.3 en Muse Code, empatados en 23,8%, Kimi K3 en Kimi Code (18,8%) y GPT-5.6 Sol en Codex CLI (16,2%). Los datos de consumo de Grok 4.6 y Kimi K3 estaban incompletos, así que su coste real puede ser más alto. Todas las cifras son de Specific Labs, no de un tercero independiente.

El orden tiene asterisco. Los intervalos de confianza del pelotón de cabeza se solapan: Fable ronda [32%, 45%], Astra [27%, 40%] y Gemini [25%, 38%]. La diferencia entre el primero y el tercero es direccional, no una brecha cerrada.

El gasto está en la verbosidad, no en la tarifa

Fable 5.1 escribe mucho más que sus rivales. En la tarea de jurisdicción fiscal generó una media de 78.000 tokens de salida por ejecución; 95.000 en el medidor de tokens de API, 86.000 en el escaneo linealizable y 88.000 en el reductor de flujo de analítica. GPT-6 Astra se movió entre 13.000 y 32.000 tokens por tarea. Ese diferencial de verborrea, y no el precio de lista, explica el salto de 2,50 a 6,96 dólares.

Para quien dirige un equipo, la lectura es sencilla: se compran unos pocos puntos de acierto al primer intento a cambio de muchos más tokens. Si un humano revisa cada parche del agente de todas formas, la opción barata con un segundo intento puede acabar en el mismo sitio por menos dinero.

Se mide el conjunto, no el modelo

El benchmark puntúa combinaciones de modelo y arnés, y lo dice de forma explícita. La demostración más clara está dentro de un mismo CLI: en Codex CLI, GPT-6 Astra llega al 33,8% mientras GPT-5.6 Sol se queda en 16,2%. En Claude Code, Fable 5.1 alcanza el 38,8% y GLM 5.3 el 28,8%. En total son 640 ejecuciones sobre ocho configuraciones y diez tareas, con pass@1 promediado sobre ocho corridas independientes por tarea e intervalos de confianza del 95%.

Las tareas son duras y el promedio esconde casi todo. Seis de las diez bajan del 15% de resolución: el barrido multirregión llega al 67,2%, la jurisdicción fiscal al 3,1% y el reductor de flujo de analítica no lo resolvió ninguna configuración probada. Las soluciones de referencia tocan una mediana de 11 archivos, con 1.742 caracteres de instrucción, y todo corre en sandboxes aislados en formato Harbor.

El dato más útil para quien despliega agentes es el modo de fallo: lo dominante son requisitos no cumplidos, no errores de sintaxis. Y dejar correr al agente más tiempo no arregla nada: las ejecuciones por debajo de diez minutos fallaron el 71,4% de las veces frente al 73,4% de las que pasaron de ese umbral, según Superpower Daily.

Ahí está el interés real de la tabla: no en elegir el modelo con mejor número, sino en asumir que el arnés, el esfuerzo de razonamiento y la verbosidad mueven la factura tanto como el propio modelo.