BookinglyTech News
Inteligencia artificial

El coste de igualar un benchmark de IA cae 13 veces al año, según Epoch AI

Epoch AI mide una caída del 47% trimestral en el precio de una puntuación fija. El MIT rebaja el avance algorítmico puro a 3 veces al año tras descontar hardware y competencia.

2 min de lecturaThe Decoder0 vistas

El coste de alcanzar un mismo nivel de rendimiento en varios benchmarks de IA se ha desplomado desde 2023. Epoch AI calcula que los precios caen de media un 47% por trimestre, unas 13 veces al año, un ritmo que según la organización no iguala ninguna otra tecnología transformadora. El dato mide precios de mercado para una puntuación fija, no progreso algorítmico ni coste real de producción.

Un grupo del MIT, con Hans Gundlach al frente y datos de precios de Artificial Analysis entre abril de 2024 y noviembre de 2025, ve caídas de 5 a 10 veces al año. Cuando descuentan el hardware más barato y la presión competitiva, el avance algorítmico puro se queda en unas 3 veces al año. La diferencia entre ambas cifras está en qué se resta: Epoch no separa hardware ni competencia.

Igualar el modelo del año pasado sí es barato

El ejemplo que da Epoch es o3 de OpenAI. A principios de 2025 marcaba 75% en GPQA Diamond, una prueba de ciencia nivel doctorado, a unos 30 centavos de dólar por pregunta. Dieciocho meses después, un modelo de la familia GPT-5.6 lograba la misma puntuación por cuatro centésimas de centavo: 1/725 del precio original. OpenAI presentó hace días los modelos GPT-6 Sol y Luna, más baratos, así que la brecha probablemente sea mayor.

Pero ejecutar el mejor modelo disponible suele salir más caro por consulta. Los modelos de razonamiento queman mucho más cómputo por tarea, y parte de la mejora en los benchmarks viene de gastar más cómputo en inferencia, no de ser más eficientes. El MIT estima que un buen trozo de la subida de un modelo nuevo en GPQA Diamond se explica por eso.

Epoch trabaja con cinco benchmarks de matemáticas, ciencia y lógica, y admite que son "mediciones razonables pero aproximadas". Para defenderse del benchmaxxing incluye Mystery Game Puzzles, un test basado en un juego que no se ha hecho público; es justo donde los costes bajan más despacio, lo que encaja con esa teoría aunque también podría ser el formato de la tarea o simple ruido en los datos.

El precio medio no elige por ti

Ninguna media sirve para escoger modelo para un trabajo concreto. Plataformas como Artificial Analysis ordenan por calidad, precio, latencia, ventana de contexto y velocidad de salida, y el más barato rara vez gana en todo. Un modelo económico con latencia alta no vale para un chatbot en tiempo real; uno de razonamiento potente puede ser demasiado lento para un flujo automatizado. Y un modelo frontera más caro puede salir a cuenta si acierta más y evita reintentos. Nada de eso aparece en una comparación de precio por token.

Lo que queda claro es la asimetría: replicar la capacidad del año pasado es mucho más barato que hace dos años, mientras competir en la frontera sigue costando. Las cifras de ambas organizaciones son suyas y dependen de qué se descuenta en cada cálculo.