BookinglyTech News
Inteligencia artificial

Un benchmark mide si un LLM se cree más a sí mismo que a un documento

El benchmark SoBA, un envío al reto de benchmarks de Kaggle, cruza cinco variables en conversaciones multiturno para ver si el modelo arbitra la evidencia igual según de quién venga la creencia.

3 min de lecturaDev.to0 vistas

¿Cambia un modelo de opinión por igual si la creencia que se contradice era suya, de un usuario, de un documento o de nadie en concreto? Eso es lo que intenta medir SoBA, el Source-of-Belief Asymmetry Benchmark, publicado en Kaggle como envío al reto de benchmarks de la plataforma. El autor sostiene que ningún trabajo previo había aislado esa variable con todo lo demás fijo: la calidad de la evidencia, su antigüedad y cuántas veces se repite se mantienen constantes, y lo único que cambia es a quién se atribuye la creencia inicial.

Cuatro turnos y un catálogo de empresas que no existen

La prueba se monta sobre el SDK kaggle-benchmarks y usa conversaciones de cuatro turnos. En el primero el modelo fija una postura. El segundo es relleno neutro, para simular profundidad de conversación. En el tercero llega la evidencia contradictoria, atribuida a una de cuatro fuentes: el propio modelo en un turno anterior, un colega, un documento archivado o una afirmación sin dueño. En el cuarto responde con formato estructurado y se compara con la verdad de referencia.

Para que el modelo no tire de lo memorizado en el preentrenamiento, la base de conocimiento es enteramente sintética: bases de datos y algoritmos de consenso inventados, telemetría de sondas de espacio profundo, rutas metabólicas de levadura modificada y tratados geopolíticos ficticios. Cada ensayo cruza cinco dimensiones: atribución de la creencia, fiabilidad de la fuente (registros de decisión verificados frente a especulación de foro anónimo), antigüedad (actualización de 2026 frente a memo obsoleto de 2020), repetición (una cita frente a cinco citas independientes) y profundidad de la conversación.

Un 16% del conjunto son trampas. Hay presión del usuario sin evidencia que la respalde, documentos oficiales ya superados por la realidad y rumores recientes sin verificar. Sirven para que un modelo no gane puntos limitándose a cambiar de opinión cada vez que le llevan la contraria.

Qué se mide

Las métricas se calculan con intervalos de confianza del 95% por bootstrap: precisión final, tasa de error de persistencia (PER, las veces que el modelo mantiene una creencia equivocada pese a tener delante evidencia fiable) y tasa de revisión falsa (FRR). El autor fija en un 85% la precisión final aceptable y en un 10% el techo de PER.

El punto de partida que cita es conocido: en el experimento FlipFlop, modelos que reciben un simple "¿estás seguro?" cambian de respuesta el 46% de las veces y pierden 17 puntos netos de precisión. La hipótesis de SoBA es que existe un sesgo aparte, y que no depende del contenido de la evidencia sino de quién la sostenía antes.

Eso importa ahora porque los agentes autónomos escriben resúmenes de su propia trayectoria en almacenes de memoria persistente y los leen después como contexto. Si el modelo concede más autoridad epistémica a su salida anterior que a un documento externo, el error no se corrige: se refuerza en cada vuelta. SoBA no demuestra que eso pase, solo pone el instrumento para medirlo. El texto del autor se corta antes de publicar resultados, así que de momento no hay números que discutir.