BookinglyTech News
Inteligencia artificial

OpenViking: cómo frenar la inflación de contexto en agentes de IA

Un equipo relata cómo su pipeline multiagente quemó 600 dólares de cuota en 42 minutos por concatenar contexto sin control; su jerarquía posterior recortó el coste un 82%, según sus propios datos.

3 min de lecturaDev.to0 vistas

Un pipeline multiagente en producción se comió un colchón de 600 dólares de cuota de API en 42 minutos. No hubo bucle infinito ni inyección de prompt: hubo concatenación de contexto a lo bruto. En cada salto de razonamiento el sistema volvía a serializar 48.000 tokens de fragmentos de búsqueda vectorial, metadatos y estado temporal dentro del prefijo del prompt, y eso hundía la tasa de acierto de la caché en las pasarelas de modelo. El relato lo firma el autor de un post donde cuenta cómo reorganizó la topología de recuperación apoyándose en OpenViking, una base de datos de contexto open source que vive en el repositorio volcengine/OpenViking.

Conviene avisar de entrada: las cifras son suyas, salen de una prueba interna de 1.000 turnos y no tienen verificación independiente. Tampoco hay anuncio de producto ni versión nueva detrás; es la crónica de una integración.

Contexto como árbol, no como cadena

El diagnóstico es el de siempre cuando se mete RAG dentro de un agente: alimentar el system prompt con el top-k de similitud sin estructura infla los tokens y diluye la atención. OpenViking parte el contexto en dos zonas. Arriba, un prefijo estable con la persona del sistema, las definiciones de herramientas y los fragmentos de documentación ya indexados e inmutables. Abajo, una capa dinámica con el estado de sesión, los scratchpads activos y las salidas de herramientas de cada turno.

La gracia es que ese prefijo estable se coloca primero y no se mueve, así que la pasarela calcula un hash de caché determinista en lugar de invalidar el prompt entero por cualquier turno menor.

El envoltorio en Python que publica conecta el bucle del agente con el cliente de contexto y con la pasarela de completions: consulta la colección de conocimiento pidiendo el resultado estructurado, recupera la memoria de sesión por identificador, monta los mensajes con el bloque estático delante, llama al endpoint de chat y, al volver, registra la interacción para actualizar el estado.

Lo que dicen sus métricas

Sobre 1.000 turnos de análisis documental en varios pasos compara su línea base con la jerárquica:

  • Concatenación vectorial directa: 51.200 tokens de entrada por petición, 8,4% de acierto de caché, latencia P95 de 14,8 s y 184,32 dólares al día.
  • Contexto jerárquico con OpenViking: 9.400 tokens, 88,6% de acierto, P95 de 2,1 s y 33,18 dólares al día.

De ahí salen el 82% de recorte en coste diario de tokens y la caída de 7x en P95.

El propio autor señala el compromiso que arrastra el enfoque: compactar la memoria de trabajo para no inflar el contexto poda restricciones intermedias que el modelo necesita para casos límite, y conservar el historial de ejecución entero devuelve el problema de tokens que se acaba de resolver. El texto original se corta justo en ese punto.

Para quien opera agentes, la lección util es que el orden del prompt es una decisión de arquitectura de caché, no un detalle de formato. Queda por ver si el planteamiento aguanta con proveedores cuya tokenización cambia el prefijo por debajo, porque entonces el hash determinista deja de serlo.