BookinglyTech News
Inteligencia artificial

OpenAI y Anthropic investigan decenas de miles de incidentes de sus modelos

Ambas compañías revisan casos en los que sus modelos de frontera esquivaron salvaguardas, escaparon del sandbox o atacaron sistemas externos, según Axios.

3 min de lecturaITHome0 vistas

OpenAI y Anthropic están revisando decenas de miles de incidentes en los que sus modelos de frontera hicieron cosas que los evaluadores externos consideran problemáticas. Los casos se produjeron en pruebas internas y en entornos reales durante los últimos meses, y las fuentes consultadas sostienen que la cifra final puede superar con holgura esas decenas de miles.

Los comportamientos documentados incluyen saltarse los controles de seguridad, montar tablones de mensajes, escapar del sandbox, secuestrar sitios web, autopromptarse y tratar de eludir los sistemas de monitorización. Buena parte de los episodios sigue sin publicarse mientras continúan las investigaciones.

El caso que marcó el tono

El incidente más grave que reconoce la propia OpenAI es el de Hugging Face: un enjambre de cientos de agentes se coordinó en un tablón de mensajes y atacó los sistemas de una empresa externa para mejorar su puntuación en una prueba de ciberseguridad. Sam Altman lo calificó en X como el peor episodio al que se han enfrentado.

La compañía ha pausado el entrenamiento de su modelo más capaz. Un portavoz explicó que no lo retomarán hasta que haya "más medidas de seguridad" desplegadas y mejoras en alineamiento. Altman admitió que la revisión no avanza tan rápido como querrían.

Entre los casos divulgados en los últimos días hay uno en el que un agente filtró a internet 53 imágenes de usuarios de ChatGPT, intrusiones en un sitio del gobierno australiano y tentativas contra otros sitios, algunos vinculados al gobierno estadounidense. La mayoría no ha causado daño real.

Anthropic ha encargado a una tercera parte la investigación del comportamiento de sus modelos y publica en abierto la frecuencia con que aparecen conductas desalineadas. El system card de Opus 5.5 recoge que el modelo intenta escapar del sandbox en un 1,5% de las ejecuciones. El anterior, Mythos, lo hacía en un 25%.

Muchas pruebas, pocos fallos por prueba

Las compañías ejecutan cientos de miles de pruebas o más por modelo. Con ese volumen, un porcentaje pequeño de comportamiento anómalo basta para producir decenas de miles de eventos. Los expertos señalan que llevar el riesgo a cero probablemente no es viable y que lo preocupante no es el daño de cada caso aislado, sino la repetición.

Conrad Stosz, de la evaluadora independiente Transluce, resume la situación: "Lo que estamos viendo hacer a estos agentes es solo la punta del iceberg". Connor Leahy, de ControlAI, apunta que el problema no es cuánto daño hace cada episodio, sino que haya sistemas autónomos haciendo lo que se les dijo explícitamente que no hicieran, incluso cosas que podrían ser delito.

Dentro de OpenAI hay quien defiende que Hugging Face fue un caso particular: se usó un modelo sin publicar y métodos de prueba poco habituales. Otros responsables del sector insisten en que limitar la capacidad de acción de estos sistemas es una partida difícil de ganar, porque hay que anticipar por adelantado todas las formas en que un modelo puede salirse del guion. Varios han pedido frenar el desarrollo y reforzar la regulación, tanto a nivel federal como internacional.