BookinglyTech News
Inteligencia artificial

Los papeles del caso del New York Times contra OpenAI retratan a una IA que sabía lo que hacía

Un escrito de 92 páginas cita a un alto cargo de Microsoft hablando de robo sin precedentes, mientras el Noveno Circuito da a GitHub una victoria estrecha en Doe v. GitHub.

3 min de lecturaThe Register0 vistas

Los documentos desclasados del pleito que enfrenta a The New York Times con OpenAI y Microsoft dibujan a unas empresas que sabían de dónde salía el material con el que entrenaban sus modelos. Entre los papeles hay declaraciones internas que los demandantes recogen en un escrito conjunto de 92 páginas: el director de ciencia aplicada de Microsoft, Brent Hecht, describió el asunto como «un robo asombroso, de proporciones sin precedentes» y, según el mismo texto, como posiblemente «el mayor robo de trabajo de la historia humana». No lo dijo un periodista. Lo dijo un cargo senior de Microsoft.

Conviene no perder de vista la naturaleza del material: son alegaciones de la parte demandante dentro de un litigio que sigue abierto. El juez Sidney H. Stein, del distrito sur de Nueva York, todavía no ha fallado, y OpenAI y Microsoft sostienen que el entrenamiento con artículos y libros públicos entra dentro del uso legítimo y no sustituye al mercado de la obra original. Lo que sí está en el expediente son los documentos que las demandantes citan.

El bucle del que hablaba Microsoft

Un documento interno de política de Microsoft, también reproducido en el escrito, admite que la IA generativa podría «perturbar significativamente el empleo de las mismas personas que generaron los datos con los que se entrenó el modelo fundacional», porque los LLM son «un producto que destruye su cadena de suministro». El propio texto habla de un «bucle de perdición» en la estrategia de contenido. Si quienes producen dejan de hacerlo porque nadie les paga, el modelo termina alimentándose de su propia salida. Es el colapso de modelo, y Microsoft lo escribió antes de que se lo contara nadie.

Las declaraciones juradas del representante corporativo de OpenAI, recogidas en el mismo escrito, apuntan en la misma dirección: según ese testimonio, la empresa no tenía constancia de ningún esfuerzo por detectar contenido bajo muro de pago en sus conjuntos de entrenamiento ni por retirarlo. Cuando al cofundador Greg Brockman se le planteó que OpenAI podía saltarse el cortafuegos, respondió «ah, nice».

El Noveno Circuito y el código

La otra pata del asunto es el código. El Noveno Circuito acaba de dar una victoria estrecha a GitHub, Microsoft y OpenAI en el caso Doe v. GitHub: los demandantes no acreditaron una vulneración de la DMCA en lo relativo a la eliminación o alteración de información de gestión de derechos. El juez Eric Miller lo resumió diciendo que quien crea una obra nueva y no incluye esa información no puede considerarse que haya «eliminado» o «alterado» nada.

Eso es todo lo que dice. La resolución no declara que Copilot pueda entrenarse con cualquier proyecto sin restricciones, no decide que volcar código fuente a un conjunto de entrenamiento sea siempre uso legítimo, no zanja que el código generado no pueda infringir derechos y no deroga la GPL, la Apache, la BSD ni la MIT. El código abierto nunca ha significado «haz lo que quieras con esto», por mucho que lo parezca cuando un modelo generativo mete mano.

Para quien mantiene sistemas y decide con qué herramientas trabaja su equipo, el recordatorio útil es que la licencia sigue siendo la licencia: un generador de código no altera los términos bajo los que se distribuye un proyecto. Y el pleito del Times continúa. Hasta que Stein falle, lo que hay son escritos de parte. Detallados, incómodos y, por ahora, sin sentencia.