Cómo medir la incertidumbre de un LLM: RLCD convierte la confianza en probabilidades
RLCD entrena al modelo para repartir probabilidades sobre los resultados posibles en vez de soltar un «seguro al 90%». El proyecto Laya, del mismo autor, afirma un error de calibración de unos 6 puntos.
Un LLM no puede medir su propia confianza. Cuando le pides que la exprese, el número sale del mismo mecanismo que el resto de su respuesta: de predecir qué diría alguien que está seguro. Un «voy con un 90% de confianza» es una elección de palabras, no una medición, y aparece igual sobre un dato acertado que sobre uno recién inventado.
Esa es la premisa de un texto técnico que propone RLCD para corregirlo. El titular promete resolver la alucinación, pero lo que describe es otra cosa: hacer que el modelo declare bien su incertidumbre. El planteamiento descarta la salida fácil, pedir una única cifra acompañada de un porcentaje, y separa el problema en dos. La incertidumbre que depende de lo que el modelo sabe y ha visto baja según se acumulan datos. La que es pura impredecibilidad del futuro no desaparece nunca.
Probabilidades en lugar de una cifra
La alternativa es pedir una distribución. En vez de una temperatura, se parte el rango de valores históricos en cubos y se pide al modelo una probabilidad para cada uno, con la suma a 1. Un modelo seguro apila casi toda la masa en uno o dos cubos; uno que va perdido la reparte. Da igual que el resultado sea la temperatura de mañana o el cierre de una acción.
Esa distribución es una afirmación sobre el mundo y se puede contrastar. Se toman todos los casos en que el modelo hizo esa misma predicción y se mira dónde cayó de verdad el valor: si dijo 60-69 grados con un 30%, debería acabar ahí alrededor del 30% de las veces. No se puntúa si acertó el día concreto, porque parte del futuro es impredecible; se puntúa si fue honesto sobre cuánto lo sabía. Un modelo sobreconfiado acumula probabilidad donde luego no pasa nada, y uno que se cubre demasiado la reparte cuando la realidad venía concentrada.
El entrenamiento copia lo que hace un meteorólogo. Lanza la predicción, prueba variantes ligeramente distintas (más peso en unos cubos, algo más cálidas en otras) y al día siguiente, cuando llega el valor real, puntúa cada versión por la probabilidad que le había dado a lo que ocurrió. Las que ganan a la media suben, las demás bajan, y el proceso se repite durante miles de preguntas. La puntuación es la parte interesante: quien siempre se declara seguro se lleva un castigo fuerte cada vez que falla, y quien siempre se cubre las espaldas nunca puntúa bien ni cuando acierta. La forma de maximizar a lo largo de muchas preguntas es decir la probabilidad real, ni más ni menos.
La cifra la da el propio autor
Laya, un proyecto entrenado con este método, declara un desvío medio de unos 6 puntos entre la confianza que expresa y la que le correspondería. El dato es suyo: está en las notas de el repositorio, sin comparación independiente contra otras técnicas de calibración.
Con una probabilidad calibrada se puede operar en vez de improvisar. El autor lo ilustra con NVDA y el criterio de Kelly: el modelo reparte probabilidades sobre el rango de cierre, se suman los cubos por encima del precio actual y sale p = 0,62, que entra directo en el cálculo de valor esperado. Es un ejemplo del método, no un historial de resultados.
Para quien monte agentes que decidan con esas salidas, la diferencia entre un 90% decorativo y un 90% medido es la diferencia entre calcular y creer. Y la calibración no viaja sola: una distribución honesta sobre temperaturas no tiene por qué estarlo sobre precios, tráfico o logs, así que toca medirla en el dominio propio. El repositorio está abierto, incluidas las notas de ajuste fino.
