El coste por tarea de la IA cae dos órdenes de magnitud en un año
Un repaso de los datos de eficiencia en GPU, motores de inferencia como vLLM y arquitecturas MoE apunta a que el precio del token deja de ser el cuello de botella de la IA.
El coste de usar modelos de lenguaje está cayendo más rápido de lo que sugiere el precio por token. Un análisis recopila las cifras que sostienen esa idea: la eficiencia energética de las GPU se duplica cada dos años, los motores de inferencia mejoran entre un 10% y un 50% anual, y el coste por tarea completada se ha desplomado dos órdenes de magnitud entre 2025 y 2026. La conclusión de quien lo firma es que el número de tokens dejará de ser el factor limitante y lo serán la calidad y el acceso.
El token no es la métrica que importa
La distinción es la base de todo el argumento. Los proveedores cobran por token, y un token es un fragmento de palabra: una palabra viene a ocupar 1,5 tokens. El precio por token de los modelos de frontera no baja de forma consistente, pero el coste de terminar una tarea sí, porque un modelo pequeño puede necesitar más tokens que uno grande para el mismo encargo: tiene que pensar más o corregir el primer borrador. El autor lo ilustra con la frontera de Pareto de coste por tarea. Sitúa en un extremo a Claude Fable-5.1, caro e inteligente, y en el otro a GPT-5.6 Luna, barato y menos capaz. Los modelos por debajo de la línea punteada, dice, no merecen consideración.
El software recorta más que el silicio
Las GPU ganan eficiencia con cada generación, pero el salto del último año está en las herramientas. vLLM pasó de la versión 0.5.4, en septiembre de 2024, a la 0.11.1, en diciembre de 2025: un 40% más de eficiencia en 15 meses, medida en julios por token y con cargas de serving, que es lo que importa cuando hay clientes mandando peticiones a horas impredecibles. NVIDIA presume de hasta un 50% de mejora en su stack de MLPerf entre la 2.0 y la 2.1, e Intel mostró un aumento de throughput de 2,4 veces solo por mejoras en MLPerf entre la 6.0 y la 6.1, con el hardware quieto. El propio autor avisa de que esto último es throughput, no eficiencia, así que no es una comparación limpia.
En paralelo cambia la arquitectura. Los primeros LLM eran densos: todas sus partes se activaban en cada entrada. Los actuales tiran de mezcla de expertos (MoE) para desactivar lo que no hace falta. Aquí entran también los pesos abiertos, que pueden ejecutarse en local —el texto pone como ejemplos Muse Glimmer o Qwen3 Coder— o alojados por un tercero, y que son mucho más pequeños que los de frontera.
Si la curva sigue, el límite deja de ser cuántos tokens puedes pagar y pasa a ser la calidad del modelo y quién te deja usarlo. El autor pone plazos: LLM como infraestructura en uno o dos años, y calidad de frontera en hardware de consumo en tres a seis. Son sus estimaciones, no medidas.
