Claude Opus 5.5 ya tiene ficha en Artificial Analysis: qué mide el índice v4.3.2
Artificial Analysis ha subido su índice a la versión 4.3.2, que combina diez evaluaciones, y ha abierto la ficha de Claude Opus 5.5. Las cifras del modelo no aparecen en la página.
Artificial Analysis ha abierto la ficha de Claude Opus 5.5 en su comparador de modelos, con el índice de inteligencia actualizado a la versión 4.3.2. La página reúne las gráficas de siempre: inteligencia, coste por tarea, tokens de salida por tarea, coste de ejecutar el índice completo, precios de entrada, salida y acierto de caché por millón de tokens, y ventana de contexto.
Lo que no aparece en el material disponible son las cifras. Ni puntuación del índice, ni precio, ni la posición del modelo frente a la competencia. Lo que hay es la metodología y la descripción de cada métrica.
Qué entra en el índice
El índice v4.3.2 agrupa diez evaluaciones: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience y AA-LCR v1.1. La lista mezcla trabajo de conocimiento con agentes, uso de terminal y codificación, razonamiento sobre documentos profesionales y contexto largo médico.
Dos de esas pruebas merecen un repaso. AA-Briefcase mide trabajo de conocimiento con agentes y su Elo combina la tasa de aprobación de rúbricas con la calidad analítica y la presentación, convertida esa tasa a Elo mediante enfrentamientos sintéticos. AA-Omniscience va por otro lado: puntúa fiabilidad del conocimiento y alucinación en una escala de -100 a 100, donde cero significa tantas respuestas correctas como incorrectas. Premia acertar, penaliza inventar y no resta nada por negarse a responder.
El resto de las gráficas son de coste y consumo. El coste por tarea se calcula con los precios de entrada, acierto de caché, escritura de caché, razonamiento y respuesta, dividido por el número de tareas y ponderado por el peso de cada evaluación dentro del índice. El consumo se mide en tokens de salida por tarea, y el coste de correr el índice entero sale de multiplicar esos precios por los tokens usados.
Por qué importa
Para quien elige modelo por API, estas fichas son la referencia rápida: Elo por capacidad, dólares por tarea y tokens por respuesta. Pero una ficha sin cifras publicadas no permite decidir nada todavía. Queda por ver si Artificial Analysis termina de rellenar las tablas y si Claude Opus 5.5 cae en el cuadrante que la propia página marca como más atractivo, el que delimita su línea de Pareto entre inteligencia y coste.


