Circuit breaker para agentes de IA: cortar el bucle antes de la factura
Los bucles de reintento de un agente autónomo multiplican el consumo de tokens en cada intento. El patrón que los detiene es un vigilante de estado externo al prompt.

Un agente autónomo de investigación se despliega un viernes por la tarde y funciona contra los datos de prueba: navega a una URL, extrae la tesis principal de un documento, la cruza contra una base de datos vectorial y devuelve un resumen en JSON. El lunes, el panel de facturación de OpenAI o Anthropic marca 542,18 dólares por el fin de semana. No ha fallado el modelo. Ha fallado el reintento: el agente topó con un CAPTCHA, no pudo parsear la página y entró en un bucle en el que cada intento arrastraba todo el historial anterior, traza de error incluida, dentro del contexto.
El circuit breaker para agentes es el patrón que ataca eso: un vigilante de estado, externo al prompt, que corta el flujo antes de que se coma la cuenta. No es una opción de configuración del framework ni una instrucción más. Es un componente con autoridad para detener la ejecución.
Un reintento con LLM no cuesta lo mismo que uno clásico
En software convencional, una llamada que falla se reintenta con backoff exponencial y cuesta fracciones de céntimo. Aquí el contexto crece en cada vuelta. La secuencia típica es esta: la primera llamada consume 2.000 tokens, el fallo devuelve una traza larga, el orquestador la reinyecta pidiendo al modelo que corrija su enfoque y la segunda llamada ya son 2.600 tokens; el modelo se inventa un parámetro, vuelve a fallar y la tercera son 3.300. En el reintento número cincuenta se están enviando 20.000 tokens por llamada solo para producir otro error.
Por eso los frameworks que exponen un flag de reintentos y poco más engañan: el desarrollador lo pone a true suponiendo que alguien ha puesto un tope detrás, y no lo hay. Si la lógica de reintento vive dentro del prompt, el control ya está perdido. Un modelo no tiene perspectiva externa para saber que lleva media hora dando vueltas.
Cuatro capas y quién dispara el interruptor
La propuesta que se está asentando en producción reparte el trabajo en una máquina de estados. Un orquestador traduce la intención del usuario y reparte tareas; una malla de ejecución con agentes estrechos (investigador, analista, programador) hace el trabajo; un verificador, otro agente o directamente un script, valida la salida contra un esquema. Y por encima, el circuit breaker, que lleva la cuenta de los tokens gastados, de la profundidad del grafo y de los patrones repetitivos. Cuando el presupuesto o el número de pasos se agota, o cuando detecta que el agente está haciendo lo mismo una y otra vez, corta y deriva a un humano en lugar de seguir intentándolo.
Los números que suelen citarse para justificar esto son de orden de magnitud, no de contabilidad exacta: entre 45.000 y 250.000 dólares de coste de implantación en el primer año en despliegues empresariales de agentes, con una parte del presupuesto quemada en bucles descontrolados durante las pruebas y las primeras semanas en producción. La cifra es de quien escribe, no de un tercero que la audite.
Lo que queda por ver es la implementación. El patrón está claro, el tope va fuera del prompt y en el estado, pero el material no trae código de referencia, y ahí es donde se decide si un equipo lo aplica o lo deja en una diapositiva.

