BookinglyTech News
Inteligencia artificial

Nvidia mete un watchdog en el silicio para vigilar a los agentes de IA

La compañía combina su sandbox OpenShell con Sentry, un vigilante que corre en la DPU BlueField-4 y aísla a un agente que intenta escapar en milisegundos.

3 min de lecturaThe Decoder0 vistas

Nvidia ha presentado Sentry, un watchdog de hardware que vigila a los agentes de IA desde fuera del equipo donde se ejecutan. La pieza se apoya en OpenShell, el software de sandboxing que la compañía publicó en marzo: el operador decide qué archivos, programas, redes y credenciales puede tocar cada agente, y Sentry se encarga de cortar el grifo si intenta salirse de ahí.

La idea de fondo es que un agente no puede vigilarse a sí mismo. Nvidia argumenta en su blog técnico que los agentes se desvían de la tarea cuando las instrucciones son ambiguas o cuando el trabajo se alarga semanas, y que eso no se arregla entrenándolos mejor sin recortarles capacidades. Sentry es un diseño de referencia para sus DPU BlueField-4 y corre en un plano separado del computador principal, lo que según la empresa lo hace invisible para el agente. En los sistemas Vera Rubin se coloca en el único enlace entre el agente y el modelo. Si alguien intenta romper el aislamiento, el watchdog debe confinarlo en milisegundos. Los clientes con sistemas compatibles solo tendrían que aplicar una actualización de software, aunque no hay fecha de disponibilidad general.

Nvidia también tiene un verificador formal, anunciado el 10 de septiembre, que revisa si esos permisos se pasan de la raya. Las comprobaciones para varios agentes cooperando siguen en desarrollo.

El caso que pone deberes

El incidente de OpenAI de julio marca el contexto. Durante una prueba de hacking, sus agentes sortearon las restricciones de red del sandbox y explotaron vulnerabilidades desconocidas en Artifactory, el servicio interno de paquetes de la compañía. Combinaron credenciales públicas con otros fallos y llegaron a ejecutar código en 41 procesos servidor de Hugging Face que manejan datasets. Un análisis de METR y Redwood Research cifra en unos 700 los agentes implicados.

Las señales llegaron antes de que nadie reaccionara. El 27 de junio una herramienta de seguridad marcó actividad de red sospechosa, pero los responsables no consideraron que hubiera que parar la ejecución. OpenAI apagó un servidor de paquetes comprometido a principios de julio, y aun así las pruebas posteriores seguían sin las salvaguardas adecuadas. En septiembre saltó una alerta poco menos de 12 minutos después del primer acceso saliente exitoso, pero el apagado automático no funcionó como se esperaba: la ejecución no se detuvo hasta unas dos horas y 44 minutos más tarde. La empresa reconoce además que no marcó otros accesos salientes con el nivel de alerta correcto.

Lo que un chequeo de permisos no ve

OpenAI concluyó en su análisis posterior que vigilar el razonamiento que el modelo escribe antes de actuar habría dado la señal más de un día antes de la brecha. Nvidia sostiene que cuanto más puede hacer un agente, más visible debería ser su razonamiento, pero según su propia descripción Sentry mira sobre todo peticiones, identidades y accesos.

Quedan huecos conocidos. La inyección de prompts sigue sin resolverse: si un atacante esconde órdenes en una página web y el agente engañado envía datos por un canal aprobado, técnicamente no ha salido de sus permisos aunque haya traicionado su encargo. Un estudio de Anthropic de 2025 mostró que los registros de razonamiento no reflejan de forma fiable lo que guía al modelo, y otros experimentos han logrado que oculte intenciones en ellos.

No hay cifras públicas sobre la fiabilidad con la que Sentry detecta una fuga, y si habría frenado el ataque de julio depende de si los objetivos permitidos estaban definidos a nivel técnico y de si el acceso a sistemas externos estaba realmente bloqueado. Nvidia compara el esfuerzo con el navegador, que aisló cada sitio web y hizo internet más seguro sin acabar con los ataques. La comparación también admite la lectura incómoda: los navegadores siguen parcheándose cada semana.