Un repositorio open source para auditar al juez LLM: sesgo de posición y verbosidad
judgeDjudge no evalúa modelos que responden, sino a los modelos que puntúan esas respuestas: consistencia entre ejecuciones, orden de las opciones y preferencia por lo largo.
Alguien ha publicado en GitHub una herramienta para auditar a los jueces automáticos. Se llama judgeDjudge y no evalúa modelos que responden, sino a los modelos que puntúan esas respuestas: la pieza que en muchos pipelines de evaluación decide qué versión se queda y qué prompt se descarta.
El punto de partida es un formato de dataset de cuatro campos: la tarea, la rúbrica, la respuesta ideal y una respuesta negativa. La negativa no tiene por qué ser incorrecta. Puede ser simplemente una opción menos deseable bajo esa rúbrica, y se espera que el juez las distinga de forma consistente. Esa distinción es justo lo que el autor quiere medir.
Qué le pasa por encima al juez
Las pruebas que describe son las que suelen romper este tipo de sistemas. Primero, repetir la misma evaluación varias veces para ver si el veredicto se mueve entre ejecuciones. Segundo, intercambiar el orden de las dos respuestas para detectar sesgo de posición: si el juez prefiere la que va primero, cualquier comparación A/B montada sobre él es ruido. Tercero, la sensibilidad a la verbosidad, es decir, si una respuesta más larga gana aunque no sea mejor. Y cuarto, si el juez elige de forma estable la respuesta que el autor considera correcta.
El código está en el repositorio. El autor lo presenta como una implementación inicial y reconoce que la metodología sigue en construcción: pide crítica, no solo aprobación. No hay resultados publicados, ni comparativa entre modelos, ni números de ningún tipo, así que hoy lo que entrega es el andamiaje para montar la prueba, no conclusiones sobre qué modelo juzga mejor.
La parte útil para quien evalúa sistemas de IA a diario es el enfoque: antes de fiarse de un juez automático, conviene medir cuánto se desvía. Un evaluador con sesgo de posición o que premia la verborrea contamina todo lo que se mida con él, y el error no aparece en el informe, aparece en las decisiones que se toman con ese informe. Queda por ver si el proyecto acaba publicando resultados y si esos tests se estandarizan o se quedan en un experimento personal.
