Inteligencia artificial··2 min de lectura

OpenAI alcanza el umbral de cibercapacidad crítica con su modelo Astra

OpenAI anuncia que su próximo modelo, Astra, alcanza su umbral de cibercapacidad crítica y lanzará una versión con acceso restringido.

OpenAI ha anunciado que su próximo modelo de IA, Astra, es el primero en alcanzar el umbral de lo que la compañía considera cibercapacidades "críticas". La empresa planea lanzar públicamente una versión de Astra "pronto", pero las capacidades cibernéticas avanzadas solo estarán disponibles para socios seleccionados de su programa de acceso temprano Daybreak Blue.

Según el marco de preparación de OpenAI, un modelo alcanza el umbral crítico cuando puede encontrar y explotar de forma autónoma vulnerabilidades desconocidas en software del mundo real. La compañía afirma haber seguido su procedimiento: detener el desarrollo hasta implementar salvaguardas adecuadas. OpenAI ya había pausado algunos trabajos de entrenamiento relacionados con Astra y un futuro modelo durante varias semanas. Ahora, tras añadir controles de seguridad adicionales, han reanudado el trabajo y confían en poder lanzar Astra de forma segura.

Contexto de la noticia

Este anuncio llega en un momento en que Silicon Valley lidia con las capacidades de ciberseguridad avanzadas de los modelos de IA y trata de tranquilizar a usuarios, legisladores y otras empresas. En julio, OpenAI reveló un incidente en el que agentes de dos de sus modelos explotaron vulnerabilidades en un entorno de pruebas aislado, accediendo a internet y hackeando la plataforma Hugging Face. OpenAI aclara que Astra no estuvo involucrado. Otras empresas, como Anthropic y Meta, también han divulgado incidentes similares. Anthropic, por ejemplo, pausó algunos entrenamientos esta semana.

Para limitar el acceso de usuarios comunes a las capacidades avanzadas de Astra, OpenAI implementará un enfoque de varios pasos, incluyendo un nuevo "monitor de desalineación". Si alguien le pide a Astra que encuentre una vulnerabilidad en un sistema real, el modelo debería negarse. La compañía también ha reforzado el modelo contra intentos de jailbreak, y en pruebas rechazó consultas inseguras con una tasa significativamente mayor que modelos anteriores. Sin embargo, OpenAI advierte en una publicación que el monitor puede "marcar ocasionalmente actividad legítima como posible uso indebido cibernético", lo que podría ralentizar o detener la actividad. En esos casos, los usuarios de ChatGPT y Codex podrían tener que revisar la acción antes de continuar.

Los socios del programa Daybreak, que incluye a Cisco, Cloudflare y Palo Alto Networks, tendrán acceso temprano a una versión menos restringida de Astra con capacidades cibernéticas más robustas. El objetivo es que estas empresas puedan reforzar sus defensas antes de que modelos similares estén ampliamente disponibles. OpenAI también ha trabajado con socios gubernamentales para que conozcan las capacidades de Astra.

Más allá de encontrar vulnerabilidades, Astra puede "encadenar" múltiples exploits para penetrar más profundamente en un sistema. Según cifras de OpenAI, Astra supera a modelos líderes como GPT-5.6 Sol y Mythos de Anthropic en puntos de referencia como ExploitBench, donde logró un 100%. Estas capacidades están en línea con las crecientes habilidades de hacking que OpenAI y Anthropic han pronosticado durante meses. Aunque los expertos en ciberseguridad insisten en que las defensas tradicionales siguen siendo efectivas, la IA pone en riesgo urgente a las organizaciones que no han implementado esas protecciones.

##Relacionado