Microsoft detecta campaña de phishing que aprovecha caracteres Unicode invisibles
Los atacantes están inyectando caracteres de etiqueta Unicode que no se muestran en pantalla pero alteran el texto procesado por sistemas de IA y filtros de spam. Microsoft Defender for Office 365 ha registrado más de 2,3 millones de mensaj

Microsoft ha identificado una campaña de phishing que explota una brecha en la lectura de texto por parte de las máquinas. Los atacantes introducen caracteres de etiqueta Unicode invisibles dentro del cuerpo del correo; estos no se renderizan en la vista, pero modifican la cadena que el software procesa. El objetivo es evadir filtros de spam y clasificadores basados en aprendizaje automático.
Los caracteres de etiqueta pertenecen al rango U+E0000 a U+E007F. Al insertarlos en palabras clave de alto riesgo, como "funding", "loan" o "credit", los filtros que buscan coincidencias exactas pierden la palabra. Microsoft reportó que el día antes de la campaña, la firma de detección de ASCII Smuggling activó en unos 21.000 mensajes. Al día siguiente, la cifra subió a más de 1,3 millones y, dos días después, superó los 2,3 millones. Los usuarios veían ofertas legítimas de préstamos y líneas de crédito.
La técnica se conoce también como ASCII Smuggling. Los tokenizadores de NLP dividen el texto en tokens antes de procesarlo; al introducir un carácter inesperado, la forma en que se generan los tokens cambia. Dependiendo del tokenizador, el carácter puede ignorarse o dividir el texto de forma diferente, lo que afecta la salida del modelo. La normalización Unicode (NFC, NFD) no elimina estos caracteres, ya que no fueron diseñados para ello.
Para las aplicaciones que no necesitan aceptar caracteres en ese rango, la solución más sencilla es eliminarlos antes de que el texto llegue al modelo. Cuando la aplicación los necesita, se recomienda comparar la cadena original con una versión sin tags y buscar diferencias, además de probar el tokenizador real. Cualquier dato limpiado debe mantenerse limpio a lo largo de todo el pipeline.
Un caso especial son los emojis de subdivisión de Inglaterra, Escocia y Gales, que utilizan secuencias de caracteres de etiqueta invisible para renderizarse correctamente. Microsoft ajustó su firma para excluir explícitamente esos casos.
Esta campaña demuestra que los atacantes pueden usar técnicas de prompt injection no solo en modelos de lenguaje, sino también para evadir controles de seguridad tradicionales. Los equipos de seguridad deben revisar la cadena de procesamiento de texto en sus flujos de IA y aplicar filtros de caracteres invisibles antes de la tokenización.
La importancia de este hallazgo radica en que el mismo método puede comprometer cualquier sistema que ingiera texto externo sin una sanitización adecuada. Las organizaciones que dependen de pipelines de IA para clasificación de correos, generación de respuestas automáticas o detección de fraude deben incorporar esta verificación para evitar que el texto invisible altere el comportamiento del modelo.


