Zhipu lanza GLM-5.3-FlashX: 200 tokens por segundo y precios un 150% más altos
El nuevo modelo de Zhipu mantiene el contexto de 1M, sube la velocidad de inferencia hasta 200 tokens/s y multiplica por 2,5 el precio de GLM-5.3-Flash.

Zhipu ha abierto el acceso a GLM-5.3-FlashX, una variante de su modelo Flash que dispara la velocidad de inferencia hasta los 200 tokens por segundo. La API ya está operativa con el Model Key GLM-5.3-FlashX y un contexto de un millón de tokens. Lo que no se mantiene es el precio: 2 yuanes por millón de tokens de entrada y 7 por millón de salida, frente a los 0,8 y 2,8 que cuesta GLM-5.3-Flash.
La compañía atribuye el salto de velocidad a la capa de infraestructura, no al modelo: dice que ha reforzado la inversión en Infra y la optimización de la inferencia sobre una base de 100.000 chips nacionales. También sostiene que Flash mantiene el mejor nivel de inteligencia de su tamaño. Son afirmaciones de la casa, sin benchmark independiente publicado.
La tabla de precios
Los tres modelos comparten el millón de tokens de contexto y el almacenamiento de caché gratuito por tiempo limitado. Lo que cambia es lo que cuesta cada token y qué modalidades acepta:
- GLM-5.3-Flash: 0,8 yuanes de entrada, 2,8 de salida, 0,23 por acierto de caché. Acepta imagen, vídeo, archivo y texto.
- GLM-5.3-FlashX: 2 yuanes de entrada, 7 de salida, 0,57 por acierto de caché. Mismas modalidades.
- GLM-5.3: 8 yuanes de entrada, 28 de salida, 2 por acierto de caché. Solo texto.
El ejemplo de llamada y el esquema de parámetros están en la documentación de la API. El endpoint es el mismo que ya usa el resto de la familia, así que cambiar de Flash a FlashX es tocar el nombre del modelo y poco más. Ahí está el interés real de la jugada: no hay migración que hacer.
Contexto
GLM-5.3-Flash se dio a conocer antes con el nombre de Ox Alpha, y según la empresa ha ido ganando volumen de llamadas entre desarrolladores. Esa parte de la historia la cuenta Zhipu, no un tercero. Lo que sí es verificable es la estructura de precios: FlashX cobra 2,5 veces lo que Flash por el mismo trabajo, y a cambio promete una latencia mucho menor.
Para quien sirve agentes o pipelines con muchas llamadas cortas, el cálculo es directo: a 200 tokens por segundo el cuello de botella deja de estar en el proveedor y se traslada otra vez al cliente. Para lotes grandes donde el coste pesa más que el reloj, Flash sigue siendo la opción sensata. La duda que queda es si FlashX aguanta ese ritmo sostenido o si los 200 tokens/s son el pico de una configuración concreta; la compañía no ha publicado condiciones de medición ni tasa de disponibilidad del endpoint.

