c010rNews
Inteligencia artificial

El DOJ respalda el uso leal de textos con copyright para entrenar modelos de IA

El Departamento de Justicia de EE. UU. argumenta que la copia de obras protegidas durante el entrenamiento de LLM no constituye infracción, reforzando la defensa de OpenAI y Microsoft en el caso del New York Times.

2 min de lecturaThe Decoder0 vistas

El Departamento de Justicia de EE. UU. se ha alineado con las empresas de IA en el litigio consolidado que enfrenta al New York Times y otros titulares de derechos. El argumento central del DOJ es que entrenar modelos de lenguaje grande (LLM) con material protegido entra dentro del uso leal, ya que la copia ocurre solo durante la fase de entrenamiento y nunca se publica directamente.

El caso, iniciado en 2023, acusa a OpenAI y Microsoft de haber usado millones de artículos del Times para entrenar modelos como GPT‑4 y lanzar productos que compiten con el periódico como fuente de información. El Times reclama miles de millones en daños y exige la destrucción de los modelos entrenados con su contenido. La postura del DOJ rompe con el informe de la Oficina de Derechos de Autor, que había rechazado una defensa de uso leal generalizada para el entrenamiento de IA, argumentando que la reproducción a gran escala y la generación comercial superan los límites tradicionales del fair‑use.

En su presentación, el DOJ cita la jurisprudencia Kadrey y una analogía con Joan Didion, quien copiaba historias de Hemingway para aprender. Según el departamento, exigir licencia por cada extracción futura sería absurdamente restrictivo, ya que la ley de derechos de autor protege la creatividad, no el proceso de aprendizaje. Además, subraya que los LLM aportan valor creativo: "Los seres humanos crean obras originales usando LLM", escribe la oficina.

El documento también cuestiona la autoridad del informe de la Oficina de Derechos de Autor, liderado por la ex registradora Shira Perlmutter, señalando que carece de fuerza vinculante y que ignora el análisis caso‑por‑caso que la legislación exige. La disputa sigue abierta y la decisión del DOJ podría sentar un precedente clave para futuros entrenamientos de IA a escala comercial.

Implicaciones

Si la postura del DOJ se mantiene, los proveedores de IA podrían seguir entrenando sus modelos con grandes corpus de texto sin necesidad de licencias individuales, aliviando un obstáculo legal que ha frenado a varios proyectos. Sin embargo, la oposición del Times y la Oficina de Derechos de Autor indica que la cuestión seguirá litigándose, y que las empresas deberán monitorizar de cerca cualquier cambio jurisprudencial que afecte a sus pipelines de datos.

Relacionado