Un revisor LLM premiaba rellenar los prompts con requisitos que la tarea no pedía
El responsable de un sitio para practicar instrucciones a modelos descubre que su evaluador automático llevaba una semana puntuando mejor las respuestas que añadían ruido, no las correctas.
El autor de un sitio donde se practica la instrucción a modelos en lugar de escribir código encontró esta semana que su revisor automático llevaba tiempo premiando lo contrario de lo que el sitio enseña. El evaluador solo recibía la instrucción del usuario y el código que generaba el modelo, nunca el enunciado del problema ni sus restricciones. Con esa información recortada, el sistema subía la nota cuando el usuario añadía frases que sonaban plausibles pero no venían a cuento.
El caso concreto que cuenta el desarrollador: en un problema cuyas restricciones fijan un rango cerrado para las entradas, el revisor sugería además contemplar valores fuera de ese rango y luego recompensaba al usuario por escribir esa frase. Es decir, estaba entrenando a la gente para inflar los prompts con requisitos decorativos. La corrección, en sus palabras, es aburrida: pasar también el texto del enunciado al revisor y dejar explícito que nada que caiga fuera de las restricciones dadas otorga puntos. Durante una semana, el sitio enseñó justo lo contrario de su propia premisa.
Dos fallos más y lo que ha cambiado
El segundo problema era cosmético y peor de lo que parece. El contador de rachas de la cabecera contaba días consecutivos de inicio de sesión, mientras el de la portada contaba días en los que de verdad se había resuelto algo o se había lanzado una revisión. Los dos números no coincidían, lo detectó un usuario y, como era de esperar, el que se mostraba arriba era el halagador. Ahora ambos salen de actividad real. Una racha que sube por abrir una pestaña es peor que no tener racha.
El tercer cambio toca el núcleo del revisor. Ahora distingue entre dos causas de fallo: que el usuario se haya quedado corto al especificar o que el modelo haya resbalado, e indica el nivel de confianza de esa clasificación. Si falta una instrucción, devuelve una frase lista para pegar en el siguiente intento. Después compara la instrucción vieja con la nueva, para que se vea qué ha aportado ese añadido en la puntuación. En el mismo lote han entrado una demo de tres minutos sin registro, pistas de tres pasos en los 70 problemas, niveles e insignias, y un selector que elige el siguiente ejercicio según el eje de puntuación más flojo de los cinco que maneja.
La lección es trasladable a cualquiera que monte un LLM como jurado en un pipeline de evaluación: si al revisor no le llega el criterio contra el que juzga, se inventará un estándar genérico y premiará lo que suene a buena práctica. El autor sospecha que el caso evidente ya está tapado, pero que quedan versiones más sutiles de la misma deriva, y lo pregunta abiertamente a quien lleve más tiempo con este tipo de montajes. La demo está en codedrills.jp, pensada primero para japonés y con un modo en inglés cuyo fraseo todavía suena rígido.