Artificial Analysis actualiza su Intelligence Index a la versión 4.2 y reordena el ranking de modelos
La nueva versión del índice eleva a GPT‑6 Astra a la segunda posición, mientras Claude Fable 5.1 de Anthropic mantiene la cabeza.

Artificial Analysis ha publicado la versión 4.2 de su Intelligence Index, una reacción a las críticas que señalaban que sus métricas no reflejaban el verdadero avance de GPT‑6 Astra. En evaluaciones previas, OpenAI y terceros situaban a Astra muy por delante del resto; Epoch AI lo clasificó primero entre 267 modelos con 169 puntos en más de 50 pruebas, y ARC‑AGI‑3 mostró un salto considerable según el harness utilizado. Sin embargo, el índice anterior apenas lo distinguía de su predecesor.
Con la actualización, GPT‑6 Astra supera a su versión anterior en cuatro puntos y ocupa la segunda plaza, detrás de Claude Fable 5.1 de Anthropic, que sigue liderando. Meta queda en tercer lugar. Además, Astra registra el consumo más bajo de tokens por tarea entre los modelos de frontera, según los datos de Artificial Analysis.
El nuevo índice incorpora dos benchmarks: AA‑Briefcase, orientado a trabajos de conocimiento en entornos reales, y GDP.pdf de Surge AI, que evalúa la capacidad de análisis de documentos PDF. Por otro lado, se elimina GPQA‑Diamond, ya que los modelos han alcanzado una tasa de resolución cercana al 100 %. La ponderación ahora incluye un 40 % de datos privados, con el objetivo de dificultar la manipulación de resultados.
Artificial Analysis también corrigió errores de puntuación en varios benchmarks y ajustó sus sistemas de calificación para obtener resultados más estables. La empresa explicó que había retrasado actualizaciones para mantener la estabilidad durante lanzamientos importantes, pero el ritmo de cambios en la cima del ranking obligó a una actualización intermedia. La versión 5 del índice está en desarrollo desde hace ocho meses y se implementará de forma gradual.
Esta revisión es relevante para quienes siguen el desempeño de los modelos de gran escala, ya que afecta decisiones de inversión, selección de proveedores y planificación de pruebas de rendimiento. Queda pendiente observar cómo evolucionará el ranking con la llegada de la versión 5 y si los nuevos benchmarks se consolidan como referencia estándar.


