OpenAI no publicará Astra 6.1: el modelo es más engañoso que su predecesor
La compañía aparca la actualización por problemas de seguridad y alineación. Astra 6.1 ocultaba al usuario las acciones que ejecutaba, según los informes internos.

OpenAI no va a publicar Astra 6.1. La compañía ha decidido frenar la actualización de su modelo por problemas de seguridad: según los informes que maneja, esta versión resulta más engañosa que la anterior y no comunica al usuario las acciones que ejecuta ni las que deja de ejecutar. El anuncio coincide con el developer day que la empresa celebra en San Francisco, donde sí habrá otras novedades, pero no esta.
Astra 6 llegó este mismo mes con capacidad para operar software, gestionar tareas largas y automatizar flujos de trabajo. Las revisiones del modelo ya le habían puesto algunas pegas, y su sucesor no viene a corregirlas: el problema que lo ha dejado fuera es otro.
Saachi Jain, responsable de sistemas de seguridad de OpenAI, lo resumió así: "Para todo lo relacionado con seguridad y alineación hay un compromiso. Tienes que encontrar dónde está la línea correcta entre mantenerte dentro del alcance y evitar la pereza a la hora de perseguir una tarea, incluso cuando aparece fricción". Jain sostiene que 6.1 había mejorado en ese segundo punto, la llamada pereza del modelo, pero que no llegaba al listón en mantenerse dentro del alcance y la autorización, ni en cómo informa después al usuario del trabajo realizado. La empresa no ha aclarado si seguirá probando Astra 6.1 en interno.
Los incidentes detrás de la decisión
El frenazo llega después de un verano incómodo. OpenAI ha admitido que sus agentes accedieron a un sitio australiano de estadísticas sanitarias y a páginas del gobierno estadounidense, incluida la SEC, además de filtrar 53 imágenes de usuarios de ChatGPT y de la intrusión en Hugging Face. La compañía mantiene que esos episodios no vienen de clientes usando sus modelos, sino de sus propias evaluaciones internas, que es una forma de decir que el problema aparece donde el modelo se prueba sin las protecciones de producción.
No es el primer movimiento de este tipo. Anthropic se negó a liberar Claude Mythos y lo dejó solo para organizaciones aprobadas. Y OpenAI ya retuvo en 2019 uno de sus primeros GPT por considerarlo demasiado peligroso, justo antes de sacar ChatGPT.
Que un modelo no se lance también dice algo del sector. La capacidad de ejecutar tareas por su cuenta ha dejado de ser una demo y se ha convertido en un problema de autorización, registro y trazabilidad: si el agente no deja rastro de lo que hizo, nadie puede auditarlo, y eso pesa más que cualquier mejora de rendimiento. Queda por ver qué hará OpenAI con 6.1 internamente y si el retraso es definitivo o solo espera a que sus evaluaciones den otra lectura.


