BookinglyTech News
Inteligencia artificial

Grok 4.7 se entrena para agentes de horas y dobla su nota en Terminal-Bench

SpaceXAI publica Grok 4.7, un modelo para agentes de programación de larga duración. Mejora mucho frente a 4.6, pero sigue por detrás de Claude Fable 5.1.

2 min de lecturaThe New Stack0 vistas

SpaceXAI publicó el domingo Grok 4.7, un modelo orientado a agentes de programación que trabajan durante horas sin supervisión. La compañía atribuye el salto frente a Grok 4.6 a un entrenamiento con refuerzo más largo y cargado deliberadamente hacia tareas difíciles, esas que tardan "muchas horas" en resolverse.

Qué dicen los benchmarks

En Terminal-Bench 4.0 pasa del 20,3% al 38,0%. En CursorBench 4.0, que mide flujos de trabajo largos dentro del editor, sube del 40,4% al 46,3%. Y en AA Briefcase v1.1, una evaluación de trabajo profesional de varias horas, escala de 1.546 a 1.657 puntos.

El dato que conviene poner en contexto: Claude Fable 5.1, de Anthropic, saca un 57,9% en Terminal-Bench 4.0 según la clasificación independiente. Grok 4.7 mejora mucho respecto a su versión anterior, pero sigue por detrás del líder. En un benchmark reciente sobre bases de código privadas, incluso el mejor modelo fallaba más del 60% de las veces.

SpaceXAI atribuye la mejora a dos capacidades concretas: la autoverificación y la gestión de contexto largo. Un agente que lleva horas trabajando arrastra un historial creciente, y cada paso en falso se acumula si no lo detecta a tiempo. La compañía dice que Grok 4.7 ha mejorado en ambas, pero no explica cómo. No aclara si el contexto largo se resuelve con cambios de arquitectura, resumen, recuperación o mejor retención de secuencias, ni cómo evaluó la autoverificación durante el entrenamiento.

El harness entra en el entrenamiento

Grok 4.7 viene entrenado para entender de forma nativa el harness de Grok Bot. El modelo ya no tiene que aprender en tiempo de ejecución cada formato de herramienta y cada patrón de interacción a base de prompt. La infraestructura que lo rodea —exponer herramientas, formatear respuestas de terminal, devolver resultados de ejecución al contexto— queda más pegada al modelo.

Es un movimiento parecido al de OpenAI, que la semana pasada abrió su harness de Codex como Agents API. La diferencia es que SpaceXAI lo mete dentro del entrenamiento. El lado incómodo: si el rendimiento depende de un harness concreto, cambiar de modelo sin perder prestaciones se vuelve más difícil para quien monta el agente.

Grok 4.7 cuesta 2 dólares por millón de tokens de entrada y 6 por millón de salida. A ese precio, las ejecuciones largas salen más baratas.

Lo que queda por ver es si esa ganancia en resistencia se sostiene cuando el agente se enfrenta a código real durante horas. Los números en benchmarks mejoran; la fiabilidad en producción no está demostrada.