BookinglyTech News
Inteligencia artificial

12 filtraciones de datos y riesgos de cumplimiento en pipelines de LLMs agente

Un auditor revela doce fallos comunes en la arquitectura de agentes LLM que pueden exponer datos sensibles en entornos regulados.

2 min de lecturar/PromptEngineering0 vistas

Un ingeniero que ha auditado pipelines de LLMs agente para sectores regulados describe doce modos de fuga de datos que aparecen en la capa de integración, no en el modelo. Los problemas aparecen tras la fase de demo y solo se detectan en auditorías posteriores.

  1. Fallos de redacción solo en el prompt – Instruir al modelo que no devuelva SSN o nombres funciona hasta que una entrada adversaria o una cadena de herramientas multipaso rompe la regla.
  2. Filtración de argumentos de herramientas – Las consultas SQL o comandos de shell generados por el agente pueden contener PII/PHI aunque la salida final parezca limpia.
  3. Fugas en la recuperación RAG – Los vectores de búsqueda suelen devolver fragmentos adyacentes que incluyen datos de otros clientes.
  4. Exposición de memoria persistente – Agentes que conservan estado entre sesiones pueden registrar identificadores sensibles en logs o almacenes de estado.
  5. Exportación de logs no solicitada – Herramientas como Datadog o Sentry capturan la carga completa por defecto, enviando datos confidenciales a dashboards externos.
  6. Fugas en la transferencia a sub‑agentes – El filtro de sanitización aplicado al flujo principal puede omitirse al pasar la tarea a un sub‑agente.
  7. Payloads de proxy no auditados – Muchas organizaciones desconocen la metadata que viaja en cada solicitud saliente; el proyecto tigerless-cost-xray permite inspeccionar el tráfico de proxy local.
  8. Filtrado probabilístico vs determinista – Usar otro LLM para validar la salida es costoso y poco fiable; una regla basada en patrones como phi‑boundary‑gate ofrece filtrado determinista.
  9. Escucha de prefijos de caché – En entornos multitenant, la caché compartida de prefijos puede revelar plantillas estructuradas de un inquilino a otro.
  10. Propagación de mensajes de error – Excepciones de base de datos pueden volcar consultas con correos y números de registro médico al buffer del agente.
  11. Inversión de embeddings – Los vectores de embedding no son anónimos; pueden reconstruirse en texto original.
  12. Herramientas de búsqueda/web sin sanitizar – Un agente que navega y raspa una wiki interna puede reenviar información de arquitectura a un endpoint público de LLM.

Estos fallos se repiten en salud, finanzas y cualquier dominio con requisitos de cumplimiento. La conclusión es clara: la seguridad debe estar en la frontera de red, no confiar en que el modelo lo haga por sí mismo.

Qué implica: los equipos deben implementar filtrado determinista en prompts, argumentos, logs y memoria; auditar proxies y herramientas de terceros; y revisar cualquier punto donde datos sensibles puedan escaparse antes de llegar a un proveedor externo.