BookinglyTech News
Inteligencia artificial

FORGE: un orquestador local de agentes IA para investigación con costes reales

El proyecto resuelve la brecha entre simuladores y ejecución real, centrándose en la observabilidad y el control de costos por token.

3 min de lecturaDev.to0 vistas

FORGE es una aplicación autoalojada en un servidor doméstico que orquesta un equipo de agentes de IA para responder preguntas de investigación. El sistema imita la dinámica de un pequeño equipo humano: un planificador define la estrategia, un investigador busca en la web, un redactor sintetiza la información y un revisor valida el resultado antes de mostrarlo al usuario. Lo distintivo no es solo la funcionalidad, sino la capacidad de observar el proceso en tiempo real: se puede ver qué agente está activo, qué fuentes lee, qué datos le ha pasado a otro y cuánto ha costado cada paso en tokens.

Arquitectura basada en eventos

La clave técnica para mantener la estabilidad fue un cambio de diseño inicial: cada ejecución (run) se define como un registro inmutable de eventos, no como un objeto de estado que se actualiza. Esto permitió que la vista en vivo y la función de reproducción (replay) compartieran la misma lógica de código. Cuando los agentes simulados se sustituyeron por modelos reales, la interfaz no cambió, ya que ambos emiten los mismos eventos estructurados.

El autor relata varios fallos críticos que desaparecieron al pasar de la simulación a la producción real. Uno de los más sutiles fue la resolución de nombres de dominio: Node.js, al no tener preferencia por IPv4 en el servidor, intentaba conectarse mediante IPv6 con un timeout de solo 250 milisegundos, lo que provocaba que todas las llamadas al API fallaran. La solución fue forzar IPv4 y extender el timeout a tres segundos.

Otro problema fue la gestión del presupuesto de salida. En muchas ocasiones, el modelo gastaba todos sus tokens en razonamiento y devolvía respuestas vacías. Ahora, el sistema detecta esto y reintenta la llamada con el doble de espacio de salida. También se añadió un mecanismo para evitar que el investigador entre en bucle infinito: ahora recibe información de cuántas rondas le quedan y se fuerza a que escriba sus hallazgos en la última iteración.

Costes y confiabilidad

El stack técnico busca minimizar gastos. La mayoría de los agentes usan GLM-5.3 Flash a través de OpenRouter, con un coste aproximado de 0,15 dólares por millón de tokens de entrada. El revisor, sin embargo, usa modelos de la familia Claude. Tras probar tres configuraciones (Sonnet con esfuerzo alto, Sonnet con esfuerzo bajo y Haiku), el autor eligió Haiku por su coste de 0,009 dólares por revisión, aunque a veces pasaba por alto errores de atribución de fuentes, un vacío que se intenta cubrir con la siguiente capa del flujo.

Un error serio detectado durante las pruebas fue que, al usar almacenamiento local en el navegador, diferentes dispositivos mostraban datos divergentes y, en ocasiones, se sobreescribían ejecuciones entre sí. Se migró a una única base de datos SQLite en el servidor, que gestiona los IDs de ejecución y empuja actualizaciones en tiempo real a todas las pestañas abiertas.

La lección central que extrae el autor tras estas tres semanas de desarrollo es operativa: nunca se debe desplegar datos simulados que se asemejen a datos reales sin etiquetarlos claramente. En FORGE, los datos simulados ahora están marcados explícitamente y solo se usan para pruebas de cableado (dry runs), impidiendo que el usuario confunda una simulación con un análisis real.