BookinglyTech News
Inteligencia artificial

Los precios de los LLM se disparan al superar los 200.000 tokens

Google y Grok doblan su tarifa por token más allá de 200.000, mientras Claude mantiene una tarifa única hasta 1 millón de tokens.

2 min de lecturaDev.to0 vistas

Google Gemini 3.1 Pro anuncia $2 por millón de tokens de entrada y $12 por millón de salida, pero esa tarifa solo vale hasta 200.000 tokens de prompt. A partir de ese punto la compañía duplica ambos precios, pasando a $4/$24. Grok 4.6 hace lo mismo con la misma barrera de 200.000 tokens, pasando de $2/$6 a $4/$12.

OpenAI, por su parte, no publica una tarifa para contextos superiores a 270.000 tokens, dejando una laguna en la que los usuarios deben estimar costos por sí mismos. Claude se comporta de forma distinta: desde la versión 4.6 no hay niveles de contexto, de modo que un prompt de 900.000 tokens se factura al mismo precio que uno de 9.000 tokens a lo largo de todo el rango de 1 millón de tokens.

Esta diferencia de precios afecta a flujos de trabajo que usan grandes contextos, como agentes de código que cargan repositorios completos o pipelines RAG que llenan la ventana de contexto. Un día típico puede requerir 260.000 tokens de entrada; bajo esas condiciones la ventaja de Gemini frente a Claude Opus 5 desaparece, ya que Gemini duplica su tarifa mientras Claude se mantiene estable.

DeepSeek adopta otro enfoque: no define un umbral de contexto, pero desde el 16 de agosto 2026 cobra según la hora del día. Durante las siete horas pico (01:00‑04:00 y 06:00‑10:00 UTC) los precios se duplican, por lo que el coste real depende del momento en que llegue el tráfico.

Otro supuesto frecuente es que una lectura de caché cueste el 10 % del precio base. En la práctica Claude Fable 5.1 paga solo 0,025 × la tarifa base, mientras Gemini 3.5 Flash‑Lite no ofrece descuento de caché alguno. Ignorar estos matices genera comparaciones que subestiman el gasto real.

Para evitar sorpresas, el autor ha publicado una tabla con todas las tarifas actuales, los umbrales de contexto, los precios de lectura de caché y la oferta introductoria de Gemini Flash que expira el 31 de diciembre 2026. La tabla está disponible en el LLM API Pricing Reference. Además, la clasificación de costos por tarea se puede consultar en los LLM Waves leaderboards, que ponderan velocidad, ventana de contexto y precios para ofrecer una visión más completa que la tarifa por token aislada.

En definitiva, cuando se trabaja con prompts extensos es imprescindible mirar más allá de la tarifa nominal. Los cambios de precio en los umbrales de contexto y las variaciones horarias pueden convertir una solución aparentemente barata en la más costosa, y viceversa.