Un 38,4% menos de errores al podar el CLAUDE.md de Claude Code en cada sesión
Un equipo mide su configuración de Claude Code en 40 tareas de refactorización: un fichero raíz de 25 líneas con habilidades bajo demanda supera al CLAUDE.md estático de 450 líneas.
Un equipo de desarrollo ha puesto número a algo que muchos sospechaban: cargar un CLAUDE.md de 450 líneas en cada sesión de Claude Code no sale gratis. En su benchmark, ese fichero monolítico produjo un 38,4% más de errores de regresión que un fichero raíz de 25 líneas acompañado de habilidades que solo entran en contexto cuando la tarea las pide.
La comparación la hicieron sobre 40 tareas de refactorización multifichero en su propio repositorio de backend. La configuración A era el CLAUDE.md estático de 450 líneas cargado siempre. La B, la versión mínima más destilación dinámica de habilidades, con poda automática de las reglas que ya no aplican.
Los números que dan: los tokens de entrada por turno bajan de unos 18.500 a menos de 3.200, y el gasto por sesión cae por encima del 45%. La explicación es mecánica. Si el agente no reingesta 400 líneas de texto fijo en cada ida y vuelta, el contexto útil queda más limpio.
El patrón que describen lo reconoce cualquiera que haya peleado con instrucciones de agente. El modelo cumple las tres primeras reglas y las dos últimas, y se salta los veinticinco casos límite enterrados en medio. Y media docena de reglas apuntaban a rutas y convenciones de mocking que el equipo había refactorizado tres semanas antes, lo que empujaba al modelo a escribir imports obsoletos.
El problema no son las reglas que faltan
Su tesis es que el mayor lastre para la precisión de un agente de código no es la instrucción ausente, sino la caducada. Cuando una librería cambia de API, un fichero de reglas sin podar enseña activamente al modelo a escribir código que rompe la CI.
Para que la configuración B fuera reproducible, publicaron su herramienta interna como autoharness, en el repositorio tigerless-labs/autoharness. Funciona así: al terminar una tarea compleja de depuración o de puesta en marcha, extrae la secuencia de comandos que funcionó y la empaqueta en un SKILL.md modular; esas habilidades solo se cargan cuando se invoca la tarea correspondiente; y si una no se ha disparado en sesiones recientes o apunta a ficheros que ya no existen, se poda. Sin demonios: Python de biblioteca estándar, sin servicios en segundo plano, sin base de datos vectorial local y sin telemetría.
Todo lo anterior son cifras del propio equipo, medidas en su repositorio y sin replicación independiente por terceros, así que conviene tomarlas como un caso propio y no como un resultado general.
Aun así, el problema que señalan es real y crece solo: el fichero de instrucciones de un agente envejece como envejece cualquier configuración, por deriva. Con agentes de código cada vez más usados en repos grandes, mantener ese texto se está convirtiendo en una tarea operativa más, con su poda y su revisión. La prueba de si aplica en tu caso es barata: contar las líneas de tu CLAUDE.md y ver cuántas siguen siendo ciertas.
