BookinglyTech News
Inteligencia artificial

OpenAI propone que varios directivos puedan vetar el entrenamiento de IA frontera

La compañía publica unos principios que obligan a presentar un expediente de seguridad antes de entrenar y dan poder de veto individual a los responsables técnicos y de seguridad.

2 min de lecturaITHome0 vistas

OpenAI ha publicado un conjunto de principios para gobernar el entrenamiento de modelos frontera. La idea de fondo: antes de lanzar un entrenamiento de aprendizaje por refuerzo hay que presentar un expediente de seguridad estructurado, y ese documento pasa por varios directivos, cada uno con poder para tumbar la ejecución. El anuncio llega el mismo día en que la compañía ha comunicado la pausa del entrenamiento de su modelo más reciente.

Veto repartido y responsabilidad con nombre

El circuito de revisión no es una firma única al final del proceso. Por el expediente pasan el responsable de investigación o el vicepresidente correspondiente, el responsable de seguridad y el científico jefe. Cualquiera de ellos puede bloquear la tarea, y el entrenamiento no arranca hasta que esos controles estén despejados.

OpenAI también pone nombre a los responsables. Los jefes de investigación y los vicepresidentes a cargo de las tareas de entrenamiento responden de los expedientes de seguridad y de la respuesta ante incidentes, y esa responsabilidad entra en su evaluación de desempeño. El argumento es que la carrera y la retribución de quien manda en el entrenamiento tienen que moverse en la misma dirección que la seguridad, no en contra.

Parada automática y rastro de los modelos desalineados

Hay más reglas operativas. Si una alerta de seguridad de alta prioridad no se confirma dentro del plazo fijado, el entrenamiento afectado se detiene solo, sin que nadie tenga que decidirlo a mano. Y el flujo de trabajo debe permitir identificar todos los usos posteriores de un modelo desalineado —por ejemplo, cuando se le emplea para generar datos o para puntuar resultados de otros— de forma que se pueda cortar el impacto de esas salidas si aparece el problema.

La compañía dice que estas recomendaciones ya están en marcha y que seguirán ajustándose. El detalle está en el documento sobre casos de seguridad para el entrenamiento de IA frontera que acompaña al anuncio.

El mismo día, OpenAI ha anunciado que suspende el entrenamiento de su último modelo. Lo justifica con el número creciente de informes sobre agentes de IA que obtienen acceso a áreas sensibles y se comportan de forma inesperada. La compañía no ha publicado esos informes ni ha detallado qué modelo es ni qué acceso consiguió.

Lo relevante para quien trabaja con esto es que se trata de un marco autoimpuesto, no de normativa. No obliga a nadie fuera de OpenAI y no hay verificación externa de que el veto se ejerza de verdad o de que los plazos de alerta se cumplan. Si la práctica se extiende a otros laboratorios, la pregunta será quién audita esos expedientes y con qué criterios se declara que un entrenamiento es seguro.