BookinglyTech News
Inteligencia artificial

Los agentes de IA fallan en debugging por falta de acceso directo al entorno

El ciclo de 'copia y pega' introduce sesgos y truncamientos que impiden al LLM diagnosticar errores reales en sistemas complejos.

2 min de lecturaDev.to0 vistas

El patrón de debug donde el desarrollador actúa como 'portapapeles' humano está limitando seriamente la efectividad de los agentes de IA en entornos de producción. La premisa central es clara: el agente necesita consultar la base de datos, leer el broker de mensajes o golpear el endpoint por sí mismo, en lugar de razonar sobre un relato filtrado por una persona que aún no sabe qué es relevante.

En Explyt, empresa que desarrolla un agente para IDEs de JetBrains, han identificado que este flujo manual es sistémico. Cuando un agente no tiene visibilidad del terminal, la base de datos o los logs de CI, el humano debe copiar la salida y pegarla en el chat. Ese proceso aplica cuatro filtros que eliminan justo los detalles que el debugging demanda: qué comando se ejecutó, qué parte se seleccionó, el truncamiento silencioso de herramientas y la compactación de contexto del propio modelo.

El problema documentado en GitHub

No se trata de una opinión aislada. Las issue trackers de los principales agentes de código están llenas de este mismo bucle. En anthropics/claude-code#13865, un usuario describe el proceso manual de añadir logs, ejecutar, copiar, analizar y limpiar, calificándolo de "lento y propenso a errores" que lleva al "shotgun debugging" (disparar a ciegas). Igualmente, en microsoft/vscode-copilot-release#10778, se reporta que el agente no ve la salida del terminal y repite comandos fallidamente hasta que el usuario selecciona el texto manualmente.

El truncamiento es un factor crítico. Una herramienta popular de ahorro de tokens ocultó 314 paquetes en una lista sin indicador de truncamiento, haciendo que la salida pareciera completa. Para un agente haciendo triaje de incidentes, esto significa ver un error transitorio y cerrar la investigación como menor, ignorando la segunda excepción en otro hilo que quedó fuera del copiado. Anthropic limita por defecto las respuestas de herramientas a 25.000 tokens, una restricción que acelera la pérdida de contexto.

La solución técnica ya existe pero suele estar inactiva. Los servidores MCP (Model Context Protocol) para bases de datos, Kafka y Kubernetes permiten al agente ejecutar consultas de solo lectura directamente. Sin embargo, las incidencias muestran agentes que adivinan nombres de columnas teniendo acceso SSH disponible o pidiendo al humano ejecutar una consulta que su propio servidor MCP podría realizar. El acceso directo es la mitad del arreglo; la otra mitad es mantener un registro de qué se consultó, qué volvió y qué conclusión se basa en qué observación, para evitar que el agente razone sobre datos incompletos.