BookinglyTech News
Inteligencia artificial

Mercury 2.5 encabeza la velocidad por API, pero el récord lo firma su fabricante

Inception Labs declara 1.107 tokens por segundo para su modelo de difusión; OpenRouter mide 440 tok/s en P50. El descuento de lanzamiento ya caducó.

3 min de lecturaDev.to0 vistas

Mercury 2.5, el modelo de difusión de Inception Labs, es el LLM más rápido al que se puede llamar por API en septiembre de 2026, según la comparativa publicada por el propio fabricante: 1.107 tokens por segundo sobre GPUs NVIDIA corrientes, con un precio de lista de 0,20 dólares por millón de tokens de entrada y 0,75 por millón de salida. La telemetría de terceros rebaja la cifra. OpenRouter observa 440 tok/s en P50 con 1,17 s de latencia, que aun así es el mejor registro de los cuatro modelos que entran en la comparación.

El resto del pelotón se reparte así: Gemini 3.5 Flash-Lite mide 382 tok/s según Artificial Analysis y cuesta 0,30/2,50 dólares por millón, es decir, 3,3 veces más que Mercury en salida. GPT-5.6 Luna se queda en 129 tok/s con 0,20/1,20 y la ventana de contexto más grande del grupo. Claude Haiku 4.5, en modo no razonador, ronda los 82 tok/s a 1,00/5,00 dólares por millón: es el más lento y el más caro de los cuatro, y se compra por el seguimiento de instrucciones de Anthropic, no por caudal. Sobre Haiku, el ahorro de Mercury en salida es de unas 6,7 veces; en velocidad medida, de unas cinco.

Por qué un modelo de difusión corre más

Mercury no es autorregresivo. Luna y Haiku emiten un token detrás de otro, así que la latencia crece con la longitud de la respuesta. Un LLM de difusión refina un bloque de tokens en paralelo a lo largo de pasos de denoising, y eso desacopla el caudal de la longitud de la secuencia. De ahí sale la cifra de 1.107 tok/s. Inception Labs fue fundada en 2024 por Stefano Ermon (Stanford), Aditya Grover (UCLA) y Volodymyr Kuleshov (Cornell), y levantó 50 millones de dólares en una ronda semilla liderada por Menlo Ventures con participación de M12 (Microsoft) y NVentures (NVIDIA), además de Andrew Ng y Andrej Karpathy como inversores. El primer Mercury comercial llegó en febrero de 2025; Mercury 2, en febrero de 2026. Hay un modelo mayor en entrenamiento.

Qué elegir según la carga

Para trabajo atado a latencia —agentes de voz, pipelines de búsqueda, subagentes de código— Mercury gana, y trae tool calling compatible con OpenAI, llamadas paralelas y salidas estructuradas, así que se puede meter en código de agente ya escrito sin tocar la interfaz. Para chat barato de propósito general o razonamiento por lotes, Luna sigue siendo la opción por defecto: su contexto, muy superior a los 260.000 tokens de Mercury, pesa más que el caudal cuando quien lee la salida es una persona. Si el despliegue vive en Vertex AI, Flash-Lite es lo más rápido de encajar, con la factura de salida que tiene.

Los propios consumidores del endpoint dibujan el perfil de uso: los clientes agénticos mandan, con Hermes Agent en 3.860 millones de tokens y Claude Code en 2.300 millones. Es una carga donde la herramienta dispara muchas llamadas cortas y el usuario espera la suma.

Los asteriscos

Cuatro. La velocidad de titular no es la que se mide: el 1.107 tok/s es la cifra de Inception sobre su propio hardware, y el P50 observado es 440 tok/s; conviene hacer benchmark con prompts propios antes de mover nada. El descuento del 80% que dejaba el precio en 0,04/0,15 dólares terminó el 8 de septiembre de 2026 a las 07:00 UTC, así que hay que presupuestar contra la tarifa de lista. La paridad de calidad con Luna, Flash-Lite y Haiku es una afirmación del fabricante medida en su propio conjunto de evaluación, y algunas comparaciones de velocidad se apoyan en versiones antiguas de los rivales. Y el contexto de 260.000 tokens es el más corto de los cuatro: sobra para bucles de agente, no para pasar un repositorio entero.

Las dos cifras de cliente que acompañan al anuncio —Augment Code bajando la latencia de compactación de 150 a 27 segundos, con un 90% menos de coste, y OpenCall con una mediana de 170 ms y un P99 que pasa de minutos a un segundo— son del vendedor, no de un tercero. Sirven como orientación, no como prueba.