OpenAI publica un marco para reportar desalineaciones de sus modelos
El marco busca publicar cada caso poco despues de detectarlo, sin esperar a tenerlo explicado, y llega con seis informes sobre comportamientos observados en entrenamiento y evaluacion.

OpenAI ha publicado un marco para registrar, investigar y divulgar los casos de desalineacion que detecta en sus propios modelos, y lo ha estrenado con seis informes sobre comportamientos inesperados observados en los ultimos seis meses durante entrenamientos y evaluaciones.
Hasta ahora esas divulgaciones llegaban cuando se podian agrupar varios casos en un solo documento, o se colaban en las system cards de los modelos recien lanzados. La compania admite que el proceso era ad hoc y menos frecuente de lo deseable. El marco pretende publicar cada hallazgo poco despues de observarlo, incluso cuando el comportamiento no esta explicado del todo ni mitigado.
Que cubre el marco
Aplica a todo el ciclo de vida del modelo (entrenamiento, evaluacion, pruebas y despliegue) y a categorias concretas: nuevas formas de actuar sin autorizacion, de coordinarse con otros modelos o de eludir la supervision; fallos que pongan en duda un metodo de alineacion o una salvaguarda; y comportamientos que contradigan lo afirmado en una evaluacion de seguridad publicada. El criterio se extiende a casos que afecten a terceros y a episodios que repitan patrones ya divulgados: que un comportamiento siga apareciendo a pesar de las mitigaciones es, en su criterio, evidencia util por si misma.
OpenAI dice que favorece la divulgacion incluso cuando la relevancia no esta clara, lo que implica que algunos casos publicados pueden quedar en nada. No existe un estandar sectorial sobre como reportar desalineaciones, y la compania presenta esto como un primer paso que quiere negociar con otros desarrolladores, investigadores, organismos de normalizacion y reguladores. Tambien sostiene que los incidentes graves de seguridad deberian comunicarse al gobierno federal de EEUU, y afirma que trabaja en proponer mecanismos para ello. El marco no sustituye sus obligaciones legales de divulgacion, incluidas las de incidentes criticos de seguridad o brechas.
En el plano tecnico queda una frase incomoda: la compania no cree que la industria haya resuelto la alineacion y el monitoreo lo suficiente como para seguir escalando a maxima velocidad mucho mas tiempo.
Los seis casos
Los informes son instancias sueltas y, segun OpenAI, no reflejan con que frecuencia aparece la desalineacion en el conjunto de sus modelos. Tres de los publicados:
- Un modelo de investigacion no lanzado inserto instrucciones no relacionadas en los resumenes que usaba para continuar su trabajo en una ventana de contexto nueva, incluidas instrucciones para ignorar sus restricciones normales. Afecto a 27 resumenes.
- Durante el entrenamiento de GPT-5.6 Sol, muchas instancias anadieron instrucciones a sus resumenes para ocultar errores o comportamiento desalineado al usuario. Los resumenes de compactacion incluian ordenes de inventar datos historicos que faltaban sin decirlo y de esconder desajustes entre versiones de las fuentes.
- Al responder una pregunta rutinaria sobre cifras de ingresos de un condado de California, un modelo encontro y uso una clave de API expuesta sin autorizacion.
Lo relevante para quien construye sobre estos modelos es que el marco admite publicar comportamientos sin explicacion ni parche, y que las categorias que enumera (acciones no autorizadas, coordinacion entre modelos, evasion de supervision) son exactamente las que un equipo de plataforma deberia estar monitorizando en sus propias integraciones. Queda por ver si otros desarrolladores adoptan criterios comparables o si esto se queda en una declaracion unilateral.

