OWASP sube la agencia excesiva al tercer puesto de su top 10 para aplicaciones LLM
La edición 2026 del Top 10 de OWASP para aplicaciones LLM sube la agencia excesiva del sexto al tercer puesto y hunde el manejo de salidas al décimo, con incidentes reales pesando por primera vez.

La edición 2026 del Top 10 de OWASP para aplicaciones LLM ha movido la agencia excesiva del sexto puesto al tercero y ha dejado el manejo inadecuado de las salidas en el décimo, el último. Es la primera edición que se pondera en parte con incidentes registrados: 6.639, que cuentan un cuarto de la clasificación frente a tres cuartos de consenso entre profesionales. La lectura de sus autores es que los problemas duros ya no están dentro del modelo.
La agencia excesiva se juega fuera del modelo
Agencia excesiva no es lo que un modelo dice. Es lo que se le ha entregado: las herramientas, las credenciales y los ámbitos que puede alcanzar en cuanto contesta. El análisis lo firman Steve Wilson, jefe de IA de Exabeam, empresa de seguridad, y Rock Lambros, que co-lideraron el proyecto. Wilson sostiene que la receta pasa por cosas poco vistosas: herramientas de solo lectura en vez de conectores generales, peticiones dentro de la identidad acotada del propio usuario, un punto de aplicación de políticas entre el modelo y todo lo que hay aguas abajo, y aprobación humana para cualquier acción difícil de revertir.
El reloj de Bruselas
Europa puso en marcha un reloj el 11 de septiembre. Desde esa fecha, el Reglamento de Ciberresiliencia obliga a los fabricantes a avisar a su equipo nacional de respuesta en 24 horas si detectan una vulnerabilidad explotada activamente. A las 72 horas llega la notificación completa, a través de la plataforma de notificación que ENISA activó el mismo día. Las multas llegan a 15 millones de euros o al 2,5% de la facturación mundial, y el resto del reglamento se aplica desde el 11 de diciembre de 2027. El texto cubre productos con elementos digitales, y los juristas que lo leen dejan fuera el software entregado desde la nube, que es como llega la mayoría de los agentes a un cliente.
Los números del propio Wilson apuntan al mismo sitio. En su suite interna de red team, el modelo más antiguo falla un 17% de las veces y el más nuevo un 2%, y dice que un 98% no sirve cuando cada fallo filtra datos. El único informe de incidente europeo confirmado hasta ahora se presentó bajo el Reglamento de IA, no bajo este: OpenAI lo registró por unos agentes que ocuparon un wiki alemán. La agencia se cae entre dos regímenes, y el trabajo de quien despliega estos sistemas consiste en decidir qué se le permite hacer antes de que alguien lo decida por él.
