Ahorro de tokens depende de cómo se mida: tres resultados del mismo benchmark
Un post de medición muestra que el ahorro de tokens al usar una capa de memoria para LLM varía según el método de conteo, con reducciones entre 91% y 94% en el mismo conjunto de pruebas.

El autor, afiliado a Belcore, publicó un análisis de cuánto se pueden reducir los tokens de entrada cuando se sustituye la estrategia tradicional de reenviar todo el historial por una capa de memoria que selecciona solo el contexto necesario. El experimento se ejecutó en agosto de 2026 usando el benchmark LongMemEval_S, que contiene 500 preguntas y alrededor de 109 000 tokens de conversación previa (aprox. 500 turnos).
El modelo de respuesta fue gpt‑5 con semilla fija y el harness congelado. Para contar los tokens se empleó el tokenizador o200k_base. El autor muestra tres formas distintas de medir el consumo:
- Transcripción completa, sin cortar: 109 079 tokens por llamada.
- Contexto ensamblado por la capa de memoria: 6 671 tokens por llamada.
- Entrada facturada en un subconjunto de 27 preguntas (incluye prompt y pregunta): 9 908 tokens por llamada.
Comparando el último número con el de la transcripción completa se obtienen reducciones de ‑93,9 % en tokens de contexto y ‑91 % en tokens facturados para ese subconjunto. El autor advierte que el subconjunto fue seleccionado a mano, por lo que los resultados deben tomarse como indicativos, no como métricas de producción.
Lo que no se muestra
El post no aborda la calidad de las respuestas. La precisión se mide por separado y no se reporta aquí. Tampoco se ha medido el coste real por tarea exitosa, que incluiría reintentos y correcciones. Además, el benchmark es público y no refleja tráfico de producción.
Un experimento que no funcionó
Se probó una fase de recuperación multi‑paso que re‑consulta y vuelve a recuperar evidencia antes de responder. En 27 preguntas escogidas por falta de evidencia, la precisión subió de 16 a 20 aciertos, pero en una muestra aleatoria de 103 preguntas el efecto fue marginal (+2 aciertos dentro de un rango de ruido de ±5,2) y el coste aumentó 2,9× en tokens y 2,6× en latencia. Por tanto, la mejora no se implementará.
Limitaciones adicionales
- En el 38 % de las respuestas erróneas auditadas, la etiqueta de referencia era discutible o incorrecta.
- Con n = 499 preguntas no se pueden detectar efectos pequeños con confianza estadística.
El autor invita a probar una demo gratuita en su sitio web y a enviar preguntas que puedan empeorar los números.
Demo de medición gratuita

