BookinglyTech News
Ciberseguridad

Una ex investigadora de Trail of Bits carga contra el informe FLAWED de 1Password

Suha Sabi Hussain denuncia errores aritméticos, diagramas incorrectos y solo 19 citas en el informe de Off-by-1 Labs, y pide una corrección o una retirada.

3 min de lecturaLobsters0 vistas

Suha Sabi Hussain, que trabajó en Trail of Bits, ha publicado un análisis en el que desmonta FLAWED, el informe con el que el laboratorio Off-by-1 de 1Password sostiene que los parches de vulnerabilidades generados por modelos frontera son a menudo defectuosos. Hussain y otros investigadores lo clasificaron como slop en cuanto salió y pasaron página. Lo que no esperaba era hasta dónde había llegado su distribución, con cobertura en prensa y presencia en hojas de ruta de equipos defensivos. Pide a la compañía una corrección o una retirada.

El problema no es solo el método

Los fallos de evaluación que ya señalaron Davi Ottenheimer y Trail of Bits no son los únicos. Hussain enumera diagramas incorrectos, errores aritméticos —cita un 2,8 presentado como "aproximadamente 4"— e inconsistencias internas que se ven hojeando el documento. El más serio, dice, es el de las citas: FLAWED afirma que hay "muy poco trabajo previo" en esa área concreta y solo referencia 19 fuentes, en su mayoría entradas de blog corporativas y un XKCD. El PatchBench publicado en paralelo lleva 73, casi todas papers académicos. AutoPatchBench de Meta no aparece por ningún lado. Tampoco el paper de NDSS sobre trampas en la investigación de seguridad con LLM, que le habría venido bien precisamente porque FLAWED incurre en varias de ellas.

Hay además un problema factual con Patch the Planet. OpenAI atribuye a Calif y HackerOne labores de triaje de vulnerabilidades, divulgación coordinada y búsqueda adicional, pero el informe solo menciona a ingenieros de Trail of Bits. Hussain, que trabajó allí, entiende que se cite lo que se tiene a mano, pero sostiene que la afirmación es inexacta y que no debería estar en un trabajo con ese formato.

Su argumento de fondo es sobre normas. Las convenciones del formato crean expectativas: si un documento adopta el tono y la estructura de investigación autorizada, tiene que traer el rigor correspondiente. Los errores son normales y por eso existen la reproducción, la crítica y las correcciones. De ahí su petición: que 1Password se asocie con investigadores académicos, contrate a gente con recorrido en investigación o hable con la comunidad antes de publicar algo con esa densidad de fallos.

A quién deja fuera

Hussain insiste en la asimetría de recursos. 1Password tiene prensa, distribución y alcance; grupos como EleutherAI, CISPA, la Universidad de Maryland o Drexel trabajan las mismas preguntas con mucho menos. Omitir trabajo académico directamente relevante profundiza esa brecha: el trabajo de la industria se lleva la atención y los pensadores reales no. Dice que quiere ver evaluadas de verdad las afirmaciones de OpenAI y que el open source merece que los recursos vayan hacia lo que de verdad lo hace más seguro.

Le han escrito CISOs, académicos e investigadores diciendo que habían detectado los mismos problemas y que no los habían planteado por falta de foro o por miedo a represalias. Ese es el coste de segundo orden que menos se ve, y explica por qué el asunto ha dejado de ser una discusión sobre un paper concreto.