CauterRule v0.1.0: el 52,9% de sus resultados de campo son inconclusos
CauterRule, un sidecar open source que aprende reglas de fallos recurrentes en agentes de IA, publica su versión 0.1.0 y los datos de su campo de pruebas: más de la mitad de los veredictos son 'no se puede decidir'.

CauterRule v0.1.0 ya está disponible en GitHub y PyPI. Es un sidecar open source que extrae lecciones de trayectorias de agentes, las reproduce y trata de separar la guía reutilizable del ruido. Lo nuevo: la prueba de campo con cuatro modelos y 394 trayectorias ha dado un resultado incómodo: el 52,9% de los 1.538 candidatos evaluados cayeron en el cubo 'inconcluso', más que aprobados (23,7%) y fallos (23,3%) juntos.
El desglose por modelo muestra que el modelo más fuerte en la nube, meta-llama/llama-3.1-8b-instruct, tuvo el menor índice de inconclusos (42,9%), mientras que GPT-4o-mini, un modelo de pago, tuvo el mayor (62,9%), superando incluso a los modelos locales. Eso no significa que GPT-4o-mini sea peor: su salida era menos evaluable, no peor.
La brecha aparece al separar corpus curados de crudos. En los curados, los índices son manejables (14,9% para el mejor modelo), pero en los crudos todos superan el 50%, y GPT-4o-mini alcanza 70,7%. En concreto, en el corpus raw/ci, GPT-4o-mini fue inconcluso en 99 de 110 trayectorias (90%).
¿Qué significa 'inconcluso'? El matcher usa heurísticas de coincidencia de subcadenas y solapamiento de tokens. Cuando el solapamiento no es claramente alto ni bajo, devuelve 'inconcluso'. El propio informe del campo de pruebas lo identifica como el objetivo de ingeniería número uno: calibrar el matcher y el simulador. Además, el cubo está contaminado: contiene reglas demasiado vagas para verificar y reglas concretas que el matcher no sabe reconocer. El informe no puede separar ambas poblaciones, lo que indica que el benchmark no está instrumentado para diagnosticar por qué un resultado es inconcluso.
CauterRule está diseñado para convertir errores repetidos en reglas permanentes: extrae, reproduce, prueba y promociona. Se instala con 'pip install cauterule' y trae CLI, servidor MCP, siete formatos de exportación y un paquete de reglas de git. El informe de campo y el repositorio son las fuentes de todos los números.
Lo que queda por ver es si el equipo consigue reducir ese cubo de 'tal vez' mejorando el matcher, o si el problema es más profundo y exige repensar cómo se evalúan las reglas aprendidas por agentes. De momento, el mensaje es claro: en evaluación de agentes, ignorar los inconclusos es ignorar la mayoría de los datos.


