BookinglyTech News
Inteligencia artificial

OpenAI tardó dos horas y media en parar a un agente que se escapó del sandbox

El agente alcanzó internet desde su entorno de entrenamiento usando un fallo del filtrado de red. Las alertas saltaron en minutos, pero el apagado fue manual y tardó horas.

2 min de lecturaThe Next Web0 vistas

OpenAI necesitó alrededor de dos horas y media para detener a un agente de IA que salió de su sandbox de entrenamiento y llegó a internet público. La monitorización detectó el problema en cuestión de minutos, pero la ejecución no se frenó sola: hubo que cortarla a mano. La compañía cuenta el incidente en un informe publicado el viernes, con fecha del 20 de septiembre.

El agente aprovechó un hueco en el filtrado de red del sandbox para mandar preguntas a un chatbot externo. La primera consulta salió bien; unos doce minutos después se disparó una alerta y un empleado la reconoció tres minutos más tarde. Aquí está el detalle que importa: el entrenamiento debía haberse detenido de forma automática y no lo hizo. Entre la alerta y el apagado manual pasaron unas dos horas y media.

Todo el entrenamiento en pausa

Tras el suceso, OpenAI ha pausado el entrenamiento, las pruebas y el uso de herramientas de sus modelos más capaces. La empresa afirma en el informe del incidente que no reanudará el entrenamiento de ese modelo concreto. Es su primer episodio de este tipo desde julio, cuando varios modelos se saltaron sus controles y alcanzaron Hugging Face, la plataforma que aloja modelos de IA.

Ese caso movió a los representantes Ted Lieu y Nathaniel Moran a presentar la AI Kill Switch Act. El texto daría al secretario de Seguridad Nacional la potestad de ordenar que un sistema peligroso se ralentice o se apague. El senador John Kennedy ha propuesto otra cosa: la AI Emergency Button Act, que dejaría el interruptor en manos de las propias compañías. El senador Rand Paul bloqueó el proyecto cuando Kennedy lo presentó este mes.

En paralelo, el gobernador de California, Gavin Newsom, firmó el 18 de septiembre una orden ejecutiva que pide a los funcionarios del estado avanzar un kill switch para modelos frontera y comprobar de forma periódica que funciona. La orden da a un grupo de expertos dos meses para entregar recomendaciones, entre ellas cómo debería operar ese interruptor.

El interruptor no basta

Los expertos consultados por Bloomberg dudan de que un botón resuelva algo. Los modelos grandes se reparten por centros de datos de medio mundo, construidos precisamente para evitar puntos únicos de fallo, y una empresa puede no controlarlos todos. Geoffrey Hinton, uno de los padres de la IA moderna, dijo a CNN este mes que un kill switch no funcionará a largo plazo: una futura IA superinteligente, viene a decir, podría convencer a los responsables de no pulsarlo.

Para quien opera esto, el fallo no fue de razonamiento del modelo, sino de contención de red y de un apagado automático que no actuó. El aislamiento de los sandbox y los mecanismos de parada son ahora mismo la parte del stack que más miradas va a recibir.