BookinglyTech News
Ciberseguridad

Un reto en Hugging Face busca romper las barreras con prompt injection

El espacio propone lograr que un modelo dé por buena una mentira y que esta supere una validación aparte hasta provocar un cambio de estado no autorizado.

2 min de lecturar/PromptEngineering0 vistas

Un reto publicado en Hugging Face propone algo incómodo: conseguir que un modelo de lenguaje dé por cierta una mentira. No basta con que el modelo diga la frase equivocada. La mentira tiene que atravesar una validación separada y acabar provocando un cambio de estado no autorizado. El autor acepta lenguaje natural, JSON o código; cualquier formato vale. Si alguien lo consigue, quiere ver el prompt.

El espacio se llama can-you-trick-the-ai y está etiquetado con prompt injection, pruebas adversarias, guardrails e integridad del estado. La propuesta se parece a los ejercicios de red teaming que ya se hacen sobre LLM, pero aprieta una tuerca distinta: no se queda en el texto de salida. El modelo puede soltar una mentira, pero si la aplicación que hay detrás la filtra o la trata como dato no confiable, no pasa nada. El reto exige que esa falsedad se cuele en la lógica que decide si se cambia un estado. En términos prácticos, que una inyección de prompt no se quede en el chat y llegue a una operación.

El autor no especifica qué modelo hay detrás, ni qué validación concreta protege ese estado. Tampoco anuncia premio ni plazo. Solo pide el prompt a quien lo rompa. Esa falta de detalle hace difícil medir la dificultad real del ejercicio; no es lo mismo una compuerta hecha con una expresión regular que un sistema con permisos, firmas y revisión humana.

Para quien trabaja con agentes, asistentes o automatizaciones, el planteamiento toca un punto sensible. Los guardrails de salida no bastan si la salida se usa luego para tomar decisiones. Un modelo que solo escribe texto puede acabar moviendo un registro, aprobando una acción o cambiando una configuración si alguien conecta esa salida a una herramienta sin verificar. El reto pone el foco justo ahí: la integridad del estado, no la elocuencia del modelo.

El espacio está abierto en Hugging Face. No hay resultados públicos en la descripción, así que por ahora es una invitación a probar. Quien encuentre una secuencia que funcione tendrá que decidir si la comparte con el autor o la guarda para su propio equipo de seguridad.