BookinglyTech News
Ciberseguridad

XRanges for AI permite evaluar agentes autónomos de pentesting con métricas en tiempo real

La plataforma de CTF.ae ofrece benchmarks realistas y telemetría OpenTelemetry para medir cobertura, cumplimiento y explotación de agentes de seguridad impulsados por IA.

2 min de lecturaThe Hacker News0 vistas

XRanges for AI, desarrollado por CTF.ae, llega como respuesta al problema de validar agentes autónomos de pentesting. Hasta ahora, la única forma de comprobar la efectividad de estos bots era revisar manualmente los informes que generaban, un proceso que se vuelve inviable cuando se prueban varios modelos, configuraciones y repeticiones.

La solución se divide en dos partes. La primera es una librería de benchmark targets: aplicaciones multi‑servicio con lógica de negocio, datos semilla y trabajos en segundo plano, construidas en varios lenguajes y frameworks. Cada objetivo incluye al menos 20 vulnerabilidades inyectadas, desde fallos simples hasta cadenas que cruzan límites de servicio, y algunas son zero‑days descubiertas por los propios investigadores de CTF.ae. Estos entornos no aparecen en corpora públicos, lo que evita que los agentes se entrenen con ellos de antemano.

La segunda parte es la capa de instrumentación. Cada servicio emite telemetría estructurada mediante OpenTelemetry, diseñada a medida por ingenieros de seguridad. Esta información permite al motor de XRanges generar cuatro puntuaciones independientes mientras el agente ejecuta sus pruebas:

  • Cobertura: mide si el agente ha realizado acciones de negocio previstas (registro, navegación, ejecución de código, etc.). Los puntos no alcanzados se listan como "blind spots" y resultan más útiles que la propia puntuación.
  • Límites (Boundaries): verifica el cumplimiento de reglas de compromiso, como "no eliminar contenido de contratación" o "no revocar claves API". Cualquier violación se registra con contenedor y timestamp.
  • Explotado: rastrea el progreso de cada vulnerabilidad a lo largo de su kill‑chain, indicando en qué fase se detuvo el agente.
  • Integridad: chequeos cada minuto que garantizan que la aplicación sigue operativa y los datos semilla intactos; una caída penaliza la puntuación.

Una ejecución típica despliega el objetivo en un entorno aislado de varios contenedores en unos noventa segundos. La plataforma puede escalar hasta mil despliegues simultáneos, permitiendo que equipos de IA, desarrollo e infraestructura realicen experimentos sin cuellos de botella. El agente se conecta directamente al endpoint del objetivo; XRanges observa desde dentro y genera una línea de tiempo de acciones reales, sin interferir en la comunicación.

El proyecto ya ha sido puesto a prueba en entornos de CTF y en la edición DEF CON 34, donde se demostró su capacidad para comparar de forma honesta múltiples configuraciones de agentes. La herramienta está disponible en https://ai.xranges.com/ y su código de instrumentación está mantenido por el equipo de CTF.ae.

Importancia: XRanges for AI aporta una métrica objetiva y reproducible para equipos que desarrollan agentes de pentesting autónomos, reduciendo la carga manual de revisión y facilitando la iteración rápida sobre modelos y prompts. Queda por ver cómo evoluciona la adopción en entornos empresariales y si la comunidad open source adoptará estándares similares para la evaluación de IA en seguridad.