La calibración no es un extra: qué significa de verdad un 90% de confianza
Precisión y calibración son ejes distintos, y un sistema puede acertar el 95% de las decisiones mientras declara confianzas que no se sostienen. El método para comprobarlo cabe en 40 líneas de Python.

Un sistema de decisiones puede acertar el 95% de las veces y, aun así, mentir en el número de confianza que devuelve en cada respuesta. Es la tesis de un análisis técnico sobre Jev, cuyas llamadas incluyen un campo de confianza: precisión y calibración son ejes diferentes, y mejorar una no arregla la otra. El propio texto avisa de que nadie, tampoco el fabricante, puede garantizar que tu 90% sea un 90% honesto. Eso se mide en tus datos, con tus criterios y con la forma concreta que tenga tu objeto de estado.
Precisión no es calibración
La precisión responde a cuántas decisiones fueron correctas sobre el total. La calibración responde a algo más fino: de todas las decisiones tomadas con una confianza declarada de X, cuántas fueron correctas. Un sistema puede clavar el 95% de las decisiones y estar salvajemente sobreconfiado en el 5% que falla, declarando un 92% en llamadas que acierta solo el 60% de las veces. Si únicamente mides precisión global, ese hueco no aparece por ningún lado.
Importa mucho en el patrón de enrutado por umbral, ese que deja pasar las decisiones de confianza alta y manda las dudosas a revisión humana o a un camino más caro. Ahí la seguridad del conjunto depende de que el número signifique lo que dice. Con un umbral de 0,85 y una precisión real del 70% en ese punto, estás aprobando en automático y en silencio una franja de tráfico bastante más arriesgada de lo que sugiere el umbral.
Cómo se comprueba
La herramienta de referencia es el diagrama de fiabilidad: se agrupan las decisiones en diez cubos según la confianza declarada (0,0–0,1, 0,1–0,2 y así) y en cada uno se dibujan dos valores, la confianza media y la precisión real. La calibración perfecta es la diagonal. Un cubo por debajo indica sobreconfianza; por encima, subconfianza, que es menos peligrosa pero manda a rutas caras decisiones que no lo necesitaban.
Para tener un número con el que alertar está el error de calibración esperado (ECE), la media ponderada de la distancia entre confianza y precisión en todos los cubos: ECE = suma de (n_b / N) × |precisión(b) − confianza(b)|, donde n_b son las decisiones del cubo y N el total. Cuanto más bajo, mejor. Como guía de campo, por debajo de 0,03–0,05 se considera bien calibrado; por encima de 0,1 el campo de confianza engaña a quien lo consume.
El texto incluye un comprobador de unas 40 líneas de Python con numpy: recibe dos arrays, las confianzas declaradas y un 1/0 por decisión según si fue correcta, y devuelve las estadísticas por cubo y el ECE. La parte barata es el código; la cara es el otro array. Para rellenarlo hay que registrar cada decisión con su confianza y, cuando llega la verdad de fondo —una revisión humana, un resultado posterior, una disputa resuelta—, si acertó o no. Casi nadie lo registra, y sin eso no hay nada que medir.
Si tienes enrutado por confianza en producción, ya estás confiando en que ese número dice la verdad. Comprobarlo cuesta una tarde de trabajo. La alternativa es seguir suponiendo que un 0,85 es un 0,85.


