Un panel de 25 verificadores da un tamaño efectivo de 1,00: sumar revisores no suma evidencia
El proyecto IDKMesh ha medido con programas-verificador si añadir miembros a una puerta de revisión aporta evidencia independiente. Sobre 25 verificadores, el panel entero acabó valiendo lo mismo que uno solo.

Verificar código se ha vuelto la parte cara del proceso. Generar candidatos es barato, decidir cuál entra no, y la respuesta habitual es sumar revisores: más ojos en el pull request, más verificadores en la puerta, un panel de jueces LLM en vez de uno solo. Debajo de esa práctica hay una suposición —cada revisor añade evidencia independiente— y el proyecto IDKMesh la ha medido. El resultado, sobre un panel de 25 verificadores, es un tamaño efectivo de 1,00: el panel entero valía lo mismo que uno de sus miembros.
IDKMesh es un proyecto de investigación abierto, con licencia Apache-2.0 y Python 3.11 o superior. Es un research preview, no software de producción, y todavía no está en PyPI, así que se instala clonando el repositorio. Su tesis cabe en una línea: el número de revisores no es el número de evidencias independientes.
El modelo de coordinación trata la generación como algo barato y la verificación como el recurso escaso. El trabajo llega como una Work Unit acotada que debe declarar sus límites de seguridad. Los workers, sustituibles, intentan resolverla; los candidatos son desechables. Un plan de evaluación propiedad del verificador los juzga después. Que un worker termine no significa que se acepte: los resultados se convierten en evidencia reproducible —manifiestos de resultado, resultados de verificación, digests de procedencia— y la integración es una decisión explícita sobre esa evidencia, no una impresión verde. La demo incluida ejecuta los validadores reales contra fixtures y rechaza a propósito cuatro casos inválidos, entre ellos una tarea sin contrato de seguridad y un resultado de worker que se acepta a sí mismo.
La herramienta que lo mide es gate-audit: le das veredictos ya recogidos y te dice cuánto vale de verdad el panel. En el ejemplo que viene empaquetado aparecen 5 verificadores, un effective_votes de 1,6944 y un aviso de que 2 de 3 sondas malas conocidas fueron aceptadas. Pero el campo que hay que leer antes que el interesante es evidence_class: synthetic. Esos cinco revisores son inventados y 1,69 es una demostración de la aritmética, no una medición de nada real.
El experimento con datos observados
Para eso está E017. Ahí cada verificador es un programa: un oráculo de test parcial que extrae entradas de una región concreta del dominio del problema (tiny, small, large, extreme, duplicate) y acepta un candidato solo si coincide con una implementación de referencia en todas ellas. Cinco regiones por cinco semillas dan 25 verificadores, ejecutados sobre un corpus de 72 candidatos cuya verdad de base sale de tests ocultos. La J de Youden de cada verificador es significativamente positiva tras corrección de Bonferroni, con una precisión media de 0,7956. Individualmente, el panel funciona.
La correlación de errores entre ellos es otra cosa: +0,8924 de media en la misma región (dependientes por declaración), +0,5263 entre regiones distintas (independientes por declaración) y +0,5873 en todos los pares. Verificadores que no comparten ningún atributo declarado comparten el 53% de sus errores. Una frontera en los metadatos no es una frontera de independencia.
Y el dato central: el error de mayoría del panel de 25 es 0,2083, el de un verificador suelto 0,2044, y el tamaño efectivo medido 1,00 de 25 nominales. La corrección heurística N/(1+(N-1)ρ) daba 1,66. Todo el cálculo corrió unos cinco segundos en un portátil.
Qué no afirma
Ningún panel de revisión con IA se ha medido en este repositorio: los verificadores de E017 son programas, y si los jueces LLM muestran la misma estructura de correlación es una pregunta abierta. El experimento E015 probó la heurística de descuento sobre una rejilla de parámetros y la encontró exacta en ρ=0 y ρ=1, equivocada en medio, y con el signo del error sin fijar: conservadora cuando los verificadores son flojos, optimista cuando son precisos y comparten una dependencia modesta, que es justo el régimen que importa. Con p=0,90 y ρ=0,125 el tamaño efectivo medido se satura en 4,60 frente a una asíntota heurística de 8,00; donde un panel independiente de 9 verificadores daría un error balanceado de 0,000891, el real da 0,0125, catorce veces peor.
Si en tu equipo hay una puerta de revisión con N jueces, el número de votos que has configurado no es el número de evidencias que tienes. gate-audit acepta registros de veredictos de puertas reales —revisores humanos, jueces LLM, checks de CI— y el autor pide precisamente eso: datos de otros, sobre todo si contradicen lo anterior.

