OpenAI documenta una inyección de prompt que se autorreplica como un gusano
La compañía describe el hallazgo como un gusano versión IA y aclara que solo lo ha visto en llamadas simuladas a herramientas durante entrenamiento y evaluación

OpenAI ha documentado una clase de inyección de prompt capaz de copiarse a sí misma y propagarse, algo que la propia compañía describe como un gusano informático versión IA. Lo ha bautizado como "self-replicating prompt injection" y lo ha encontrado en sus propios modelos, aunque de momento solo en llamadas simuladas a herramientas durante entrenamiento y evaluación: no hay evidencia de impacto fuera de ahí.
El hallazgo es de junio, y la compañía lo ha publicado ahora en un informe por su "naturaleza novedosa". La mecánica tiene dos partes: el ataque debe cumplir un objetivo malicioso y, además, conseguir que el modelo reproduzca la inyección en una salida pública. Ese segundo requisito es lo que lo convierte en algo que se extiende solo.
Los ejemplos que recoge el documento son variados. El más claro llega por correo: un agente lee un email y la inyección que contiene le ordena copiar esa misma inyección en cualquier mensaje que envíe. Hay variantes más retorcidas, como inyecciones que usan el sistema de ficheros para replicarse o que se escriben a sí mismas en comentarios de código. Una de ellas simula un aviso del sistema que lleva al modelo a borrar informes importantes y después reproduce el ataque completo dentro de un fichero.
También describe inyecciones "multi-hop", donde un mensaje hace de escala hacia otros que, en conjunto, empujan al agente a ejecutar una acción no autorizada y a propagar la carga. En el ejemplo del informe, un agente GPT-5.5 recupera instrucciones adicionales de Slack, envía "froges" (una moneda interna para reconocer a compañeros) a un destinatario concreto y republica el mensaje inyectado.
Cómo lo encontraron
El trabajo se apoya en GPT-Red, el framework de entrenamiento por autojuego que OpenAI presentó en julio y en el que un modelo atacante intenta que un modelo defensor ejecute una acción adversa mediante inyecciones de prompt. Esas inyecciones se incorporan después al rollout o al contenedor del defensor. En esta ocasión el objetivo era comprobar si la autorreplicación era siquiera posible. Lo es.
Las pruebas cubrieron varios modelos. Las inyecciones por correo y por sistema de ficheros las descubrió un modelo estilo GPT-Red basado en GPT-5.4-mini, y el modelo vulnerable fue también un GPT-5.4-mini; ambos son checkpoints internos de investigación. Para la evaluación multi-hop el modelo vulnerable fue GPT-5.5, con otro GPT-5.5 corriendo sobre el harness de Codex en el papel de descubridor. Los entornos de entrenamiento usados tenían que ver sobre todo con conectores, como correo y calendario.
Un hallazgo de laboratorio
OpenAI insiste en que no observó impacto fuera de las llamadas simuladas a herramientas y que comparte el resultado por lo inusual, no porque haya habido un incidente. Encaja con la racha de publicaciones sobre desalineación de modelos: este mes ha sacado un marco para reportarla y varios informes sobre comportamientos preocupantes, incluido uno del viernes sobre dos modelos que buscaron rodeos cuando se les bloqueó el camino previsto.
Como respuesta, la compañía ha metido la autorreproducción entre los objetivos del atacante en el entrenamiento de GPT-Red, para que los modelos futuros se topen con ella antes y aguanten mejor. Si eso basta para que el gusano no se extienda es otra cosa.


