Grok 4.7 de xAI: precios agresivos pero lejos de GPT-6 y Claude en benchmarks
El nuevo modelo de xAI cuesta poco por token, pero sus resultados en coding agéntico y su índice general muestran una brecha clara frente a la competencia occidental.

Elon Musk y su equipo de xAI han lanzado Grok 4.7, el modelo más capaz de la compañía hasta la fecha para tareas de código y trabajo cognitivo. La empresa afirma que se basa en un modelo base más grande y ha sido entrenado con refuerzo por aprendizaje más prolongado, con el objetivo específico de que el modelo verifique mejor su propia salida. Sin embargo, los datos públicos sugieren que, aunque el precio es competitivo, el rendimiento no está al nivel de los líderes del mercado occidental.
El precio no esconde la brecha de rendimiento
La fijación de precios es donde xAI busca diferenciarse. Grok 4.7 cuesta 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida. Estas tarifas se acercan más a las de los modelos chinos que a las de los modelos frontera occidentales, lo cual habla por sí mismo sobre las expectativas de rendimiento.
En el índice de inteligencia independiente de Artificial Analysis (v4.3.2), que combina diez benchmarks, Grok 4.7 obtiene una puntuación de 46. Esto lo sitúa a mitad de tabla. Los líderes claros son Claude Fable 5.1 y GPT-6, ambos con una puntuación de 53. La diferencia de siete puntos en un índice compuesto no es trivial para quien evalúa arquitecturas para producción.
La distancia se amplifica notablemente en pruebas de coding agéntico. En Terminal-Bench 4.0, Grok 4.7 logra solo un 26 por ciento de éxito. Por contra, GPT-6 Astra alcanza el 60 por ciento y Claude Fable 5.1 el 55 por ciento. Incluso DeepSeek V4.1 Flash, que es más barato, supera a Grok 4.7 con un 27 por ciento. Para un equipo de desarrollo, un modelo que falla en el 74 por ciento de las tareas agénticas en una terminal es difícilmente viable para flujos de trabajo críticos, por muy barato que sea el token.
Grok 4.7 está disponible a través de la Grok API, en Cursor y en Grok Build. La decisión de xAI parece ser una apuesta por el volumen y el precio, asumiendo que la brecha de rendimiento se cerrará en futuras iteraciones, aunque por ahora los números de Artificial Analysis pintan un panorama claro: si necesitas el mejor coding agéntico hoy, Grok 4.7 no es la opción.
Para los administradores de sistemas y arquitectos, la conclusión práctica es simple: el coste por token bajó, pero la calidad por dólar también. Antes de migrar cargas de trabajo de código a Grok 4.7, conviene validar el rendimiento real en los casos de uso específicos, ya que la media general oculta debilidades graves en la ejecución auto-servida.
