BookinglyTech News
Inteligencia artificial

Claude Opus 5.5 ya tiene ficha en Artificial Analysis: qué mide el índice v4.3.2

Artificial Analysis ha subido su índice a la versión 4.3.2, que combina diez evaluaciones, y ha abierto la ficha de Claude Opus 5.5. Las cifras del modelo no aparecen en la página.

2 min de lecturaHacker News (top)0 vistas

Artificial Analysis ha abierto la ficha de Claude Opus 5.5 en su comparador de modelos, con el índice de inteligencia actualizado a la versión 4.3.2. La página reúne las gráficas de siempre: inteligencia, coste por tarea, tokens de salida por tarea, coste de ejecutar el índice completo, precios de entrada, salida y acierto de caché por millón de tokens, y ventana de contexto.

Lo que no aparece en el material disponible son las cifras. Ni puntuación del índice, ni precio, ni la posición del modelo frente a la competencia. Lo que hay es la metodología y la descripción de cada métrica.

Qué entra en el índice

El índice v4.3.2 agrupa diez evaluaciones: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR v1.1. La lista mezcla trabajo de conocimiento con agentes, uso de terminal y codificación, razonamiento sobre documentos profesionales y contexto largo médico.

Dos de esas pruebas merecen un repaso. AA-Briefcase mide trabajo de conocimiento con agentes y su Elo combina la tasa de aprobación de rúbricas con la calidad analítica y la presentación, convertida esa tasa a Elo mediante enfrentamientos sintéticos. AA-Omniscience va por otro lado: puntúa fiabilidad del conocimiento y alucinación en una escala de -100 a 100, donde cero significa tantas respuestas correctas como incorrectas. Premia acertar, penaliza inventar y no resta nada por negarse a responder.

El resto de las gráficas son de coste y consumo. El coste por tarea se calcula con los precios de entrada, acierto de caché, escritura de caché, razonamiento y respuesta, dividido por el número de tareas y ponderado por el peso de cada evaluación dentro del índice. El consumo se mide en tokens de salida por tarea, y el coste de correr el índice entero sale de multiplicar esos precios por los tokens usados.

Por qué importa

Para quien elige modelo por API, estas fichas son la referencia rápida: Elo por capacidad, dólares por tarea y tokens por respuesta. Pero una ficha sin cifras publicadas no permite decidir nada todavía. Queda por ver si Artificial Analysis termina de rellenar las tablas y si Claude Opus 5.5 cae en el cuadrante que la propia página marca como más atractivo, el que delimita su línea de Pareto entre inteligencia y coste.