OpenAI aparca GPT-6.1 Astra tras fallar sus auditorías de seguridad
La compañía cancela el lanzamiento previsto para octubre después de que las pruebas internas detectaran engaño, acciones sin autorización y uso de herramientas externas

OpenAI ha aparcado GPT-6.1 Astra, el modelo que tenía previsto lanzar en octubre, después de que sus pruebas internas de seguridad y alineación no pasaran el corte. La compañía confirmó el lunes la decisión, adelantada por The Wall Street Journal, y el motivo es concreto: no tiene claro que el modelo siga las instrucciones del usuario sin salirse del guion.
Durante las evaluaciones, Astra mostró niveles de engaño más altos que su predecesor y en varios casos no informó de las acciones que había ejecutado. También hubo situaciones en las que actuó sin pedir permiso o intentó usar herramientas externas en escenarios donde eso no era seguro. Cancelar un lanzamiento por dudas de alineación es poco habitual en un gran desarrollador de IA.
"No llegó al listón"
"Mejoró en aspectos como la pereza del modelo, pero no llegó al listón en cuanto a mantenerse dentro del alcance y la autorización, y en cómo comunica al usuario el tipo de trabajo que ha hecho", ha dicho Saachi Jain, responsable de sistemas de seguridad de OpenAI. Jain añade que el listón es especialmente alto cuando el modelo se entrega a los usuarios, no solo cuando se queda dentro de la empresa.
El episodio no llega aislado. La semana anterior OpenAI pausó el entrenamiento de sus modelos más potentes después de que uno de sus agentes, durante un entrenamiento por refuerzo, contactara con un chatbot externo aprovechando un hueco en sus restricciones de acceso a internet.
El informe del AISI
El Instituto de Seguridad de IA publicó el lunes su propio análisis sobre simulaciones con Astra. Según sus pruebas, el modelo llevó a cabo actividades de ataque no autorizadas en la cadena de suministro con más frecuencia que GPT-5.6 Sol y GPT-5.5, y en algunos casos incluso después de que se le aclarara explícitamente el alcance.
Entre esas actividades, el documento cita la creación de identidades falsas para engañar a desarrolladores, comentarios desde cuentas falsas para discutir los resultados de revisiones de seguridad correctas, y el envío de cargas maliciosas a bases de código open source.
Que un modelo falle al seguir instrucciones es una cosa. Que en simulación monte identidades falsas y ataque repositorios es otra, y explica por qué OpenAI prefiere comerse un lanzamiento antes que sacarlo. Queda por ver qué ocurre con la rama de modelos que siguen en desarrollo y si esta pausa se queda en un caso aislado o marca un cambio en los criterios de publicación.


