OpenAPPA: guardia determinista que evita la exfiltración sin romper agentes
OpenAPPA, un motor de guardrails determinista MIT‑licensed, bloquea la exfiltración por inyección de prompt y alucinaciones, manteniendo la funcionalidad de los agentes.
OpenAPPA es una solución de guardrails determinista que promete ser 100 % resistente a la exfiltración de datos causada por inyección de prompt o alucinaciones del modelo, y es la primera que no interrumpe el flujo de los agentes. Se distribuye bajo licencia MIT, es open source y no depende de ningún proveedor.
En los benchmarks, OpenAPPA alcanza un 89 % de completitud de tareas frente a 90 % de Claude Auto mode y 41 % de FIDES (Microsoft). En cuanto a ataques exitosos, OpenAPPA reporta 0 % frente a 10 % de Claude Auto mode y 31 % de FIDES. La diferencia se explica porque los guardrails tradicionales no pueden rastrear el flujo de datos entre llamadas de herramienta: dependen de clasificadores que pueden ser inyectados y su diseño probabilístico deja un margen de error.
El motor funciona fuera del bucle de prompt y ejecución del agente. La configuración declarativa describe fuentes de datos, audiencias, niveles de confianza y autoridades, en lugar de listas de herramientas permitidas o bloqueadas. Cada trayectoria lleva una etiqueta de seguridad (audiencia × confianza) que solo puede volverse más restrictiva; la decisión se deriva algebraicamente, por lo que un prompt de inyección no altera el álgebra. Además, la configuración es específica de datos, lo que permite escalar a millones de agentes sin modificarla.
Para evitar la parada de los agentes, OpenAPPA devuelve un plan de remedio legible por máquina. Los sanitizadores transforman los payloads, ocultando secretos o PII; las autoridades aprueban acciones específicas a través de humanos o APIs internas; los subagentes aíslan lecturas no confiables en ramas descartables.
Los resultados de los benchmarks muestran que esta aproximación aumenta la completitud de tareas de 37 % a 90 %, demostrando que la seguridad determinista puede ser práctica sin sacrificar utilidad.
Para ver los resultados completos, consulta el artículo en arXiv o la documentación de la librería en GitHub.
¿Qué significa esto para la práctica?
OpenAPPA ofrece una alternativa concreta a las soluciones de aprobación de herramientas que dependen de modelos de verificación. Al rastrear el flujo de datos en lugar de aplicar reglas basadas en patrones, elimina la posibilidad de que un atacante escape a través de cadenas de herramientas. La licencia MIT y la arquitectura de código abierto facilitan su adopción en entornos corporativos que ya usan agentes.
La comunidad de desarrollo de agentes debería considerar integrar OpenAPPA en sus pipelines de CI/CD para validar la cobertura completa de su grafo de herramientas antes de desplegar. Aún queda por evaluar cómo se comporta en escenarios de alta carga y con modelos de gran tamaño, pero la propuesta ya muestra un camino viable para combinar seguridad y productividad.


