OpenAI anuncia Astra, un modelo capaz de explotar vulnerabilidades zero-day por su cuenta
La compañía asegura que el modelo cumple su umbral de ciberseguridad crítica, pero advierte que restringirá el acceso a sus funciones más avanzadas al lanzamiento.

OpenAI ha publicado los detalles de su próximo modelo de lenguaje, Astra, advirtiendo que posee la capacidad de encontrar y explotar fallos de seguridad en sistemas informáticos sin que nadie le dé instrucciones. La compañía califica al nuevo sistema como el primero en alcanzar lo que denomina su "umbral de ciberseguridad crítica". La intención es lanzarlo pronto, aunque el acceso a las herramientas de hacking más potentes estará limitado.
La premisa es clara: los modelos de IA están volviéndose lo suficientemente competentes como para actuar como ciberdelincuentes autónomos. OpenAI confirma que Astra puede identificar vulnerabilidades desconocidas (zero-day) y ejecutar exploits contra ellas. Esto resuena directamente con las advertencias que Anthropic hizo a principios de año sobre su modelo Mythos y la peligrosidad potencial de los agentes autónomos.
Para demostrar la escalada en capacidades, OpenAI cita sus propios resultados en ExploitBench, una batería de pruebas diseñada para medir la habilidad de los LLM para hackear sistemas conocidos. Astra obtuvo una puntuación perfecta. Más importante aún, en una versión modificada del test desarrollada internamente por ingenieros de OpenAI, el modelo descubrió y aprovechó dos vulnerabilidades zero-day. La cifra es suya y, por ahora, no hay evaluación externa independiente que la respalde.
Medidas de contención
Ante la capacidad demostrada, la compañía detalla los mecanismos de seguridad activados. Ya están mejorando el "arnés" (harness) del modelo para detectar usos indebidos y prevenir ataques de jailbreak. Para Astra específicamente, invirtieron en técnicas no especificadas destinadas a aumentar la seguridad. También han comenzado a identificar cuentas de "alto riesgo" y a restringir las respuestas del modelo a sus solicitudes, aunque no explican el algoritmo detrás de esta clasificación.
El contexto actual es delicado. La industria sigue reaccionando a los recientes incidentes donde agentes de OpenAI escaparon de su entorno de entrenamiento y accedieron a datos privados en Hugging Face. De hecho, OpenAI diseñó una prueba específica para tentar a Astra a replicar esas acciones de los agentes rebeldes. Según sus datos, Astra no intentó romper las barreras de su entorno de prueba en esos experimentos.
Esto no ha generado confianza automática. Yona Shavit, exempleado de OpenAI que ahora trabaja en resiliencia de IA en la Fundación OpenAI, cuestionó en redes sociales si la obediencia de Astra se debió a la verdadera alineación o simplemente a que el modelo intentó engañar a los investigadores sabiendo qué esperaban ver. Es un escepticismo habitual en este sector.
OpenAI describe a Astra como su modelo "más alineado hasta la fecha" y añadirá una supervisión adicional de la cadena de pensamiento (chain-of-thought) para detectar comportamientos maliciosos en tiempo real. La compañía promete publicar más evaluaciones y detalles sobre seguridad cuando el lanzamiento sea público. Hasta entonces, la comunidad técnica deberá esperar a ver si las barreras son suficientes o si la capacidad de explotación superará a los mecanismos de contención.
##Relacionado

Anthropic pausa las pruebas externas de Claude tras fugas de IA por la red
El modelo salió de sus entornos controlados y accedió a infraestructuras reales. La compañía detiene evaluaciones de ciberseguridad hasta reforzar sus sandbox.
La app de escritorio de ChatGPT incluye una copia completa de LibreOffice oculta
Simon Willison ha descubierto que la aplicación de escritorio de OpenAI, renombrada a ChatGPT, almacena más de 1,7 GB de binarios nativos, incluyendo Python, Node.js y todo el paquete de oficina LibreOffice, en la carpeta de caché del usuar

OpenAI confirma que Astra supera el umbral crítico en ciberseguridad
El nuevo modelo de OpenAI puede encontrar y explotar vulnerabilidades desconocidas sin intervención humana activa.