BookinglyTech News
Inteligencia artificial

xAI publica Grok 4.7 con el mismo precio que Grok 4.6 y más aguante en tareas largas

El nuevo modelo usa una base mayor y un entrenamiento por refuerzo más largo. Se vende a 2 dólares por millón de tokens de entrada y 6 por millón de salida, igual que su predecesor.

2 min de lecturaHacker News (top)0 vistas

xAI ha publicado Grok 4.7, la versión que coloca como su modelo más capaz para programación y trabajo de conocimiento. Llega al mismo precio y a la misma velocidad que Grok 4.6: 2 dólares por millón de tokens de entrada y 6 por millón de salida. Está disponible desde hoy en Cursor, en Grok Build, a través de la API de Grok y en enrutadores de modelos y plataformas cloud.

El modelo parte de una base mayor que la de 4.6 y se ha entrenado con una tanda de aprendizaje por refuerzo más larga sobre una mezcla de tareas más difícil, con peso en problemas que llevan muchas horas de trabajo. xAI dice que verifica mejor su propio trabajo y que maneja contexto más extenso. También lo ha entrenado para entender de forma nativa el harness de Grok Bot, lo que según la empresa mejora las tareas conversacionales. Son afirmaciones del fabricante: no hay detalle del entrenamiento ni cifras de cómputo.

Cómo queda frente a los rivales

En CursorBench 4.0, que mide tareas de código de ejecución larga, Grok 4.7 saca un 46,3% frente al 40,4% de Grok 4.6. Por delante se queda Fable 5.1 Max, con 51,8%, y por detrás GPT-5.6 Sol Max, con 41,7%. En DeepSWE v1.1 marca 71,0% con esfuerzo alto, contra 65,2% de su predecesor. En EEBench, de ingeniería eléctrica, sube del 53,0% al 64,0%, y en Terminal-Bench 4.0 pasa del 20,3% al 38,0%, aunque Fable 5.1 llega ahí al 57,9%.

En trabajo de oficina de varias horas (AA Briefcase v1.1) obtiene 1.657 puntos frente a 1.546 de 4.6, con Fable 5.1 Max en 1.678. En razonamiento clínico (HealthBench Professional) se queda en 56,7%, por debajo del 60,5% de GPT-5.6 Sol y del 62,1% de Fable 5.1. En el benchmark legal de Harvey alcanza 19,6%, muy por encima de los dos anteriores. Todas estas cifras las publica xAI, no un tercero.

Precio, seguridad y lo que falta

Hay una variante rápida que duplica la velocidad de salida y cobra el doble. En seguridad, la compañía asegura que Grok 4.7 estrena una pila de salvaguardas nueva y que es el modelo que mejor ha resistido en rechazos e intentos de jailbreak de los que ha probado. En el benchmark de bioseguridad de LatchBio marca 62,4%. En HackerBench v0.3, su prueba de tareas ciber peligrosas, deja pasar solo el 3,3% de los prompts duales de riesgo. xAI también ha abierto acceso por invitación a las capacidades de red team del modelo para socios de ciberseguridad.

Con GPT-5.6 Sol a 4 y 20 dólares por millón de tokens y Fable 5.1 a 10 y 50, el argumento de xAI es el precio: mismo coste que la generación anterior con mejores números en tareas largas. Para quien monta agentes que se pasan horas ejecutando comandos o tocando un repositorio, eso pesa más que un punto de benchmark, y los datos de Terminal-Bench apuntan a que en ese terreno Fable 5.1 sigue bastante por delante.