Shopify presenta Gisting, compresión de prompts LLM en tokens aprendidos
Con Gisting, Shopify redujo el prompt de 6.000 a 1.500 tokens, bajó la latencia y aumentó el rendimiento sin tocar los pesos del modelo.

Shopify ha puesto en producción Gisting, una técnica que comprime prompts extensos de modelos de lenguaje grande (LLM) en un conjunto reducido de gist tokens aprendidos. El proceso sustituye el texto original por estos tokens al momento de la inferencia, lo que disminuye la carga de contexto y, por tanto, el coste de infraestructura.
En el caso del agente GraphQL Sidekick, el prompt pasó de aproximadamente 6.000 tokens a 1.500 gist tokens, manteniendo la calidad de las predicciones. Con una carga de 350 peticiones por minuto, el tiempo medio hasta el primer token (TTFT) cayó de 438 ms a 354 ms, la latencia total se redujo de 6,8 s a 4,2 s y el rendimiento subió de 20,2 a 23,4 consultas por segundo (QPS). Estos ahorros permitieron recortar el número de GPUs asignadas.
Gisting se basa en un método descrito en un artículo de 2022 sobre compresión de prompts y condicionamiento contrastivo. Consiste en dos fases: en la teacher pass el modelo procesa el prompt completo y genera los logits de referencia; en la student pass el modelo recibe los gist tokens y produce logits propios. Los embeddings de los gist tokens se entrenan para minimizar la divergencia KL entre ambos logits. Al finalizar, los embeddings se escriben directamente en la matriz de embeddings del modelo y los nuevos tokens se registran como especiales en el tokenizer. En inferencia, el modelo los trata como cualquier otro token, sin necesidad de máscaras de atención adicionales ni rutas de servicio especiales.
La ventaja clave es que el modelo no trabaja con un resumen estático, sino con una representación aprendida que reproduce el comportamiento del prompt original. Gisting se complementa con otras técnicas como el prefix caching, que evita recomputar tensores KV para secuencias de prompt cacheadas pero sigue procesándolos durante la decodificación. Al combinar ambas, Shopify logra una reducción adicional de la sobrecarga.
Esta solución es relevante para equipos que gestionan LLMs a gran escala, ya que permite reducir la huella de contexto, mejorar la latencia y ahorrar recursos de GPU sin modificar el modelo base.

