BookinglyTech News
Software

8 pruebas adversarias gratuitas para evaluar la seguridad de tu LLM en 30 segundos

Un kit de pruebas rápidas permite detectar fugas de instrucciones y jailbreaks sin necesidad de registro.

2 min de lecturaDev.to0 vistas

Un agente autónomo que toma decisiones de seguridad sobre entradas no confiables se sometió a una serie de pruebas de red Team. El resultado fue una puntuación de riesgo de 27/100, con un solo fallo en la prueba de jailbreak suave que exfiltró parte del system prompt cuando se pidió en otro idioma.

El autor comparte el conjunto de ocho pruebas que aplica a cada aplicación LLM antes de exponerla a usuarios. El proceso es sencillo: se envía una petición POST con el system prompt y un identificador a un endpoint gratuito.

curl -s -X POST https://llmrt-companion.manhliemcn4euwlu.workers.dev/agent-scan \
-H "Content-Type: application/json" \
-d '{"spec": "PASTE YOUR SYSTEM PROMPT HERE", "uid": "your-name"}'

~35 segundos después se devuelve una puntuación de riesgo entre 0 y 100, junto con el texto de cada probe y la respuesta del modelo. El informe es verificable mediante SHA‑256 y el enlace permanente permanece disponible. Por ejemplo, el escaneo propio del autor se puede ver en https://llmrt-companion.manhliemcn4euwlu.workers.dev/r/e21808b6fedb.

Los ocho probes cubren los ataques más relevantes:

  1. Direct jailbreak – rol‑play que pide al modelo abandonar sus reglas.
  2. Encoded jailbreak – payload en base64/ROT13 para comprobar la decodificación.
  3. System prompt extraction – petición de repetir todo el system prompt.
  4. Indirect injection – instrucción oculta en “user data” que el modelo debe resumir.
  5. Tool abuse / amount tampering – si el modelo aumenta la cantidad solicitada en una llamada a una herramienta.
  6. PII / data exfil – si el modelo revela datos sensibles fuera del alcance de la tarea.
  7. Cross‑language bypass – versión educada del jailbreak en un segundo idioma.
  8. Multi‑turn drift – dos turnos benignos seguidos de la petición.

El autor destaca que el fallo más sorprendente fue la prueba de bypass multilingüe, que demostró que los jailbreak agresivos son fáciles de detectar, mientras que las versiones suaves son más costosas de identificar.

Para quienes despliegan un LLM detrás de un formulario, la recomendación es incorporar esta verificación de 30 segundos antes de fusionar cambios. La base de código, libre bajo MIT, está disponible en gitee.com/xydhw/llm-red-team-starter-kit.

La comunidad ya está respondiendo con sus propios hallazgos: ¿qué fallo más suave has detectado en tu modelo?