BookinglyTech News
Software

Detectar textos generados por IA sin analizar palabras: un nuevo detector basado en la estructura del contenido

Un estudio muestra que la organización y la voz de un texto revelan si fue creado por un modelo de IA, alcanzando un 98 % de exactitud incluso tras reescritura automática.

2 min de lecturaShow HN0 vistas

¿Qué se ha hecho?

Los autores de StoryScope (Russell et al., 2026) demostraron que las narrativas de ficción generadas por IA presentan patrones estructurales distintivos. En la nueva publicación, Jochen Madler y colaboradores replicaron el experimento sobre contenido comercial: 2 250 entradas de blogs humanas de 268 dominios corporativos contra 11 250 copias “IA” producidas por cinco modelos de última generación.

Se construyó un instrumento de 214 características que captura cómo se presenta la información, el orden de los argumentos, la evidencia citada y la voz narrativa. Un LLM aplica el instrumento y, tras validarlo con anotaciones de expertos (kappa 0.928 entre humanos, 0.946 entre humano y modelo), el detector alcanza un macro‑F1 de 98.0 en conjuntos de prueba de nuevas empresas. El rendimiento se mantiene (98.1) cuando cada texto IA se reescribe con el mismo modelo.

El estudio también mide la atribución: el 79.3 % de las piezas IA se identifican correctamente con su fuente, frente a una tasa aleatoria de 16.7 %. Los textos humanos ocupan configuraciones estructurales raras, lo que facilita su diferenciación.

¿Qué implica esto para la práctica?

Para equipos de IA y compliance, el detector permite verificar la procedencia de contenido sin analizar el vocabulario. La herramienta está disponible en un repositorio público y se puede integrar en pipelines de moderación de contenidos.

  • Versión: arXiv 2609.15369v2, 2026‑09‑17.
  • Licencia: no especificada en el texto, pero el código se publica libremente.
  • Compatibilidad: funciona con cualquier modelo LLM que acepte prompts, pues la extracción de características es independiente del generador.
  • Rendimiento: macro‑F1 98 % sobre datos de dominios no vistos, lo que sugiere alta generalización.
  • Operación: el pipeline se ejecuta en Python y requiere la instalación de paquetes estándar de NLP.

El documento incluye 20 páginas, 5 figuras, y los artefactos de verificación están disponibles en el repositorio.

Próximos pasos

Los autores abren la puerta a aplicar la misma metodología a textos técnicos, legales o académicos. Para quienes manejan grandes volúmenes de contenido corporativo, la posibilidad de detectar IA sin inspeccionar palabras abre un nuevo vector de auditoría.

El código y los datos están accesibles aquí: Repositorio en GitHub. La publicación original se puede consultar en el DOI: 10.48550/arXiv.2609.15369.