Estudio muestra que el acuerdo bruto sobreestima la precisión real de los jueces LLM entre 33 y 41 puntos
Un análisis de 541 000 juicios realizados por 21 jueces LLM de nueve proveedores revela una gran brecha entre el acuerdo bruto y el kappa corregido por azar.
Un equipo evaluó 541 000 juicios generados por 21 jueces LLM provenientes de nueve proveedores diferentes. El hallazgo consistente fue que el acuerdo por coincidencia exacta (raw‑match) exagera la precisión corregida por azar (Cohen’s kappa) entre 33 y 41 puntos porcentuales en todos los modelos analizados.
El estudio, titulado Reliability without Validity (arXiv:2606.19544, junio 2026), introduce el concepto de "deflación del kappa" para describir esa brecha. En el benchmark MT‑Bench, la deflación media del cohorte fue de 38,6 puntos. Incluso el mejor juez, Gemini 3.1 Pro, mostró una diferencia de 33,8 puntos: su acuerdo bruto alcanzó el 84,9 % mientras que su kappa corregido fue sólo 0,511, lo que corresponde a una discriminación moderada.
Tres conclusiones adicionales del trabajo son relevantes para la práctica de evaluación en producción:
- Cambios de posición en los rankings: la posición de un juez puede variar hasta 14 puestos entre diferentes benchmarks. Un modelo que lidera en MT‑Bench puede quedar decimocuarto en JudgeBench, lo que indica que la superioridad es específica del benchmark.
- Paradoja consistencia‑sesgo: dos jueces desplegados en producción mostraron una fiabilidad test‑retest superior a 0,95 pero un sesgo de posición superior a 0,10. La alta reproducibilidad no garantiza corrección; simplemente indica que el error se repite de forma constante.
- Sesgo de verbosidad reducido: bajo la misma rúbrica pareada, la variación por verbosidad fue menor a 0,011 para los 21 modelos.
El estudio también cuestiona la variabilidad del 20‑40 % reportada en la literatura de 2023, sugiriendo que podría deberse a artefactos de ingeniería de prompts más que a limitaciones intrínsecas de los modelos.
Implicaciones para la evaluación en producción
- Informar siempre el valor de kappa, no sólo el porcentaje de acuerdo bruto. Un dashboard que muestra "87 % de acuerdo" probablemente está inflando la capacidad discriminativa en más de 30 puntos.
- Adoptar comparaciones por pares con intercambio de posición (A‑then‑B y B‑then‑A) y tomar la mayoría para evitar que la primera opción gane ~60 % del tiempo por azar.
- Calibrar los jueces con un conjunto retenido de etiquetas humanas y medir la deflación del kappa para cada benchmark y distribución de etiquetas.
- Incorporar trazas de producción en los conjuntos de regresión; el mismo evaluador que califica filas sintéticas debe anotarse como atributo en las trazas reales para cerrar la brecha offline‑online.
El equipo ha implementado una pila de evaluación que soporta reporte de kappa, intercambio de posición en comparaciones por pares y pruebas de regresión con trazas de producción, con el objetivo de validar salidas LLM contra la lógica de negocio real en lugar de métricas infladas.