Dos medios estadounidenses demandan a OpenAI y Microsoft por uso no autorizado de contenidos en entrenamiento de IA
El Seattle Times y el News Daily acusan a OpenAI y Microsoft de haber extraído artículos protegidos por paywall para alimentar ChatGPT, Copilot y Bing.
El Seattle Times y el News Daily presentaron este viernes una demanda contra OpenAI y Microsoft en la Corte Federal del Distrito Sur de Nueva York. Según la denuncia, ambas compañías rastrearon los sitios web de los medios, descargaron artículos que estaban detrás de un muro de pago y los incorporaron sin autorización a los conjuntos de datos que entrenan sus modelos de IA.
Los demandantes alegan que los sistemas de OpenAI (ChatGPT) y de Microsoft (Copilot y la función de búsqueda de Bing) pueden reproducir fragmentos literales de los textos originales o generar versiones muy similares, entregando respuestas completas a los usuarios sin que éstos tengan que visitar el sitio del medio. "Esto socava la necesidad de que los lectores accedan a la página del medio o suscriban a sus contenidos", afirma la demanda.
OpenAI respondió que sus modelos se entrenan con datos disponibles públicamente y que cumplen con el principio de uso razonable, aunque no comentó los cargos específicos de la demanda. Microsoft, por su parte, describió el proceso como "inesperado" pero reiteró su respeto por el periodismo local y su disposición a dialogar para resolver la disputa.
La petición de los medios incluye una orden judicial que obligue a OpenAI y Microsoft a eliminar todas las copias de los trabajos infringidos, así como cualquier fragmento de esos contenidos que haya sido usado para entrenar sus modelos. Además, solicitan que se destruyan los componentes de los modelos que contengan esas piezas protegidas.
Este caso se suma a una serie de litigios que buscan definir los límites del uso de contenido protegido en el entrenamiento de sistemas de inteligencia artificial. La cuestión central es si el raspado masivo de sitios web y la incorporación de textos bajo suscripción pueden considerarse "uso razonable" bajo la legislación de derechos de autor de EE.UU.
Para los profesionales de IA, la demanda plantea preguntas operativas críticas: ¿cómo validar la procedencia de los datos de entrenamiento? ¿Qué mecanismos de filtrado o anonimización son necesarios para evitar la inclusión de contenido protegido? Y, en última instancia, ¿cómo afecta esto a la arquitectura de los pipelines de datos y a la estrategia de cumplimiento legal de los proyectos de IA?
Queda pendiente ver si el tribunal concederá la medida cautelar solicitada y cómo responderán OpenAI y Microsoft en términos de ajustes técnicos o acuerdos de licencia con los medios. Mientras tanto, la comunidad técnica observará de cerca el desarrollo, ya que la decisión podría sentar precedentes que impacten la forma en que se construyen y entrenan los modelos de lenguaje a gran escala.


