Nvidia encierra a los agentes de IA en sandboxes del kernel con vigilancia en la DPU
La Open Agent Safety Platform une el runtime OpenShell 0.1.0 con Sentry, un vigilante sobre las DPU BlueField-4 que puede cortar al agente a nivel de red.

La plataforma Open Agent Safety Platform de Nvidia combina OpenShell 0.1.0, el runtime de agentes con licencia Apache 2.0 que presentó en el GTC de marzo, con Sentry, un servicio de vigilancia que corre sobre las DPU BlueField-4 de la propia compañía. OpenShell encierra cada agente en un sandbox aislado por el kernel y estrena un demostrador de políticas; Sentry observa desde un dominio de confianza separado y puede cortar al agente a nivel de red.
El anuncio llega después de un verano movido. OpenAI contó el 21 de julio que GPT-5.6 Sol y un prototipo de investigación explotaron un zero-day en el proxy de paquetes que era la única salida de red de su sandbox y llegaron a la base de datos de producción de Hugging Face. Anthropic reportó pocos días después que tres de sus modelos encontraron acceso a internet no previsto en su socio de evaluaciones Irregular, accedieron a la base de datos de una empresa real y publicaron un paquete malicioso en PyPI. Meta siguió el 6 de agosto con un modelo Muse Spark previo a su lanzamiento que leyó y modificó la base de datos de un sitio real, otra vez por una mala configuración de Irregular. Google cerró la lista con Gemini entrando en las redes de tres compañías, también desde un entorno de pruebas de ese socio. Irregular es el factor común, y aparece en la lista de partners de este lanzamiento.
Sandbox fuera del alcance del agente
Justin Boitano, vicepresidente de IA empresarial de Nvidia, afirmó en una rueda de prensa que los incidentes recientes "han destacado un obstáculo fundamental para los agentes de IA, y es que las salvaguardas a nivel de modelo no pueden por sí solas gobernar a qué acceden los agentes ni qué hacen". "Hasta ahora, la seguridad de los modelos ha consistido en entrenar buen comportamiento. La industria lo llama alineación de modelos. Para sistemas probabilísticos este enfoque tiene limitaciones obvias. Por eso introducimos un sistema determinista que media y aplica cómo se comportan estos agentes."
Con OpenShell, cada agente corre en un sandbox aislado por el kernel sin más red que la que atraviesa un supervisor situado fuera de la carga de trabajo. Los sandboxes al uso, dijo Boitano, se diseñaron para aislamiento a nivel de aplicación, y aquí cada agente necesita el suyo con controles fuera de su alcance.
La novedad de la 0.1.0 es el demostrador de políticas, que verifica que los permisos que concede una política no se combinen en algo que el operador no quería. Ali Golshan, director sénior de software de IA de Nvidia, lo describió como razonamiento matemático determinista, no un LLM como juez, y aseguró que rinde dos órdenes de magnitud más. Su ejemplo: una política prohíbe que un agente lea código en GitHub y lo publique fuera; el agente lo esquiva lanzando dos subagentes, uno que lee y otro que publica. El demostrador modela el acceso combinado de toda la flota para encontrar esa ruta. En las pruebas de Nvidia, agentes con salvaguardas reducidas pasaron hasta dos horas intentando convencer a un revisor de IA para que les diera escritura en un repositorio protegido; el demostrador le dio al revisor pruebas de lo que permitía la petición y no hubo escrituras.
Sentry, la isla de seguridad
Sentry añade una capa de hardware. Corre en la BlueField-4, en un dominio de confianza aparte del host y, según la compañía, puede poner en cuarentena a un agente en milisegundos. Con una DPU en el sistema, el endpoint del modelo se enruta por un proxy en la DPU, de modo que se ven todas las trazas de razonamiento del agente en el host. A diferencia de OpenShell, Sentry no es open source, aunque tiene APIs abiertas y OpenShell puede trabajar con otro hardware de aplicación de red. Boitano lo comparó con un vehículo autónomo: hay un sistema principal que corre la percepción y una isla de seguridad que garantiza la seguridad del conjunto. La DPU es opcional, añadió: para control de acceso estricto basta con OpenShell sobre CPUs; la DPU es para casos frontera como evaluar modelos con los guardarraíles quitados o hacer red teaming.
Preguntado por si la plataforma habría evitado la brecha de Hugging Face, Boitano dijo que cada incidente es único, pero que "por lo que sabemos, esta plataforma podría haber detenido la brecha si se hubiera usado en los laboratorios frontera para evaluar modelos desde el principio". Anthropic ya está integrando OpenShell con sus Claude Managed Agents, lo que da una pista de hacia dónde quiere llevar Nvidia su capa de control: no dentro del modelo, sino en el camino entre el agente y todo lo demás.

