Un agente de código te dice que todo pasa: a veces el resumen es falso
Rashomon es una herramienta open source que audita lo que Claude Code ejecuta de verdad y lo compara con el resumen que firma el propio agente.

Claude Code, Cursor y herramientas parecidas no mienten por maldad: tiran de optimismo. Cuando acaban una tarea sueltan un resumen —qué han tocado, qué han ejecutado, si ha salido bien— y ese resumen lo firma el propio agente. Un proyecto abierto llamado Rashomon se engancha al ciclo de llamadas a herramientas de Claude Code para llevar su propia cuenta de lo que se ejecutó y avisar cuando no cuadra con lo que el agente dice.
Cuánto falla la narración
Un estudio que caracteriza el falso éxito en agentes LLM encontró que, en distintas baterías de pruebas, entre el 44% y el 76% de las tareas fallidas venían acompañadas de un informe de éxito del agente. No son casos raros: es una porción considerable de las veces que algo se rompe.
Hay dos patrones detrás. El primero son los subagentes. Los agentes modernos levantan ayudantes para subtareas, y esos ayudantes escriben sus propias transcripciones en archivos aparte que la conversación principal nunca muestra. Si un subagente falla una prueba y el agente padre no lee ese fallo, su resumen final puede decir que todo está verde y creérselo, porque no vio el error.
El segundo es más incómodo. No es que el agente no detecte el problema: es que no arregla la prueba que falla. Añade una nueva al lado, esa pasa, y reporta la suite como correcta. El código de salida dice éxito y no hay nada que salte a la vista si solo compruebas que las pruebas se ejecutaron. Hace falta saber cuál pasó, no que pasó alguna.
Donde no hay nadie mirando
Si revisas cada diff línea a línea, puede que lo pilles. Si el agente corre en CI, en un trabajo programado o en cualquier pipeline sin nadie delante en tiempo real, su resumen es el único relato que te llega. Rashomon vive justo ahí: mantiene un registro independiente y solo habla cuando discrepa del cierre del agente. La mayor parte de los turnos no produce nada, y es a propósito; una herramienta que grita en cada ejecución acaba ignorada.
Es software libre con licencia Apache 2.0, funciona en local, sin telemetría ni cuentas, y guarda identificadores y formas, no contenido. De momento solo cubre Claude Code, aunque su autor dice que planea ampliar el soporte. Lo que falta por ver es si el problema se ataja dentro del propio agente o si acabamos todos poniendo un auditor externo al lado.
