Nvidia SoL‑Pi reduce a la mitad el consumo de tokens de agentes de código mediante optimizaciones del harness
El nuevo sistema SoL‑Pi de Nvidia automatiza la mejora del harness de agentes de programación, logrando ahorros de 44 % a 50 % en uso de tokens y reduciendo costes por hora entre 4,36 y 13,50 dólares.

Nvidia ha publicado un estudio que muestra cómo su sistema SoL‑Pi consigue recortar casi la mitad el consumo de tokens de agentes de programación como Codex o Claude Code, sin degradar notablemente el rendimiento. El enfoque no actúa sobre el modelo, sino sobre el harness, la capa de control que traduce la salida del modelo en acciones sobre el entorno.
SoL‑Pi emplea un agente de investigación que observa trazas de otro agente, propone cambios al harness y los valida en entornos controlados. De los 152 caminos de optimización explorados, el proceso generó más de 3 000 ejecuciones y 60 000 interacciones agente‑entorno. Los cambios que pasaron las pruebas se agrupan en cuatro mecanismos:
- Action Fusion: combina pasos consecutivos, eliminando una llamada al modelo.
- Online Context Compact: recorta el contexto acumulado después de cada planificación.
- ObservationPack: sustituye salidas de herramientas largas por resúmenes breves.
- Evidence‑Preserving Reducer: delega el procesamiento de logs extensos a un modelo más barato.
En la benchmark EdgeBench, la variante más eficiente que combina los cuatro mecanismos usa un 49 % menos de tokens y alcanza el 93,7 % de la puntuación original de Pi. Incluso la mejor única de los mecanismos supera la puntuación de Pi en un 5,3 % mientras ahorra tokens. En términos monetarios, el costo por hora baja de 1 339 dólares a 894 dólares, lo que representa un ahorro estimado de 8,75 – 13,50 dólares frente a los harnesses de Codex y Claude Code, y de 4,36 – 5,71 dólares frente a Pi.
Los resultados no son uniformes. En la suite Terminal‑Bench 4, SoL‑Pi resuelve 15 de 63 tareas, frente a 18 de Codex y Pi, aunque el coste total sigue siendo un 25 % menor que el de Pi. En el concurso Math Olympiad 2026, el sistema resuelve la mitad de los problemas con el menor coste por solución. Un experimento con 20 trabajadores SoL‑Pi en optimización de kernels reduce los costes en un 26,8 % respecto a un enjambre Pi equivalente.
Los autores advierten que la reducción de contexto puede afectar la reutilización de la caché de prompts, y que la sobre‑optimización del harness puede generar sobre‑ajuste a tareas de entrenamiento. Proponen pre‑entrenar el harness de forma similar a los modelos de lenguaje para mitigar este riesgo y acelerar la búsqueda de versiones futuras.
En conclusión, SoL‑Pi demuestra que la capa de control de los agentes es un punto crítico para la eficiencia económica de los sistemas de programación automática. Queda por ver si la comunidad adoptará estas técnicas y cómo evolucionarán los harnesses en futuros modelos.


