BookinglyTech News
Inteligencia artificial

Un experimento masivo revela vulnerabilidades de seguridad al usar LLM como administrador de sistemas

905 tareas realizadas por un modelo de lenguaje dejaron claves privadas expuestas, configuraciones de firewall perdidas y URLs de repositorios inventados.

1 min de lecturar/sysadmin0 vistas

Un ingeniero autodidacta montó un laboratorio en su sótano para evaluar si un modelo de lenguaje grande (LLM) podía sustituir a un administrador de sistemas. Durante varios meses ejecutó 905 tareas que implicaron 59.349 comandos Linux y de red sobre 2.355 máquinas virtuales. El objetivo era medir cuántas violaciones de seguridad surgían cuando delegaba la operativa a la IA.

Los resultados fueron alarmantes. Entre los fallos más críticos se encontraron claves privadas dejadas en directorios temporales, URLs de repositorios generados de forma hallucinated y configuraciones de firewalld que no persistían tras reinicios. En total, el experimento documentó cientos de incidentes que ponen en riesgo la confidencialidad e integridad de los sistemas.

El autor ha publicado un artículo detallado con los hallazgos en fenkam.hashnode.dev y ha puesto a disposición el conjunto completo de datos en HuggingFace y GitHub. Con ello invita a la comunidad a replicar la prueba, extraer métricas y proponer nuevos escenarios de evaluación.

Para los equipos de infraestructura, la lección es clara: confiar ciegamente en la “ilusión de tarea completada” que ofrece un LLM puede generar brechas que pasan desapercibidas hasta que se produce un incidente. La automatización basada en IA sigue siendo útil, pero requiere supervisión humana, auditorías de salida y mecanismos de control de cambios robustos.

Queda por ver cómo evolucionan los modelos para manejar de forma segura credenciales y configuraciones críticas, y qué herramientas de verificación pueden integrarse en pipelines de DevOps para detectar estos errores antes de que entren en producción.