Oxford permite que OpenAI entrene modelos con escaneos de la Bodleian Library
La universidad británica entregó a OpenAI 125.000 escaneos de tesis históricas, según documentos internos revelados por el Guardian.

Oxford ha autorizado a OpenAI a incorporar escaneos de textos antiguos de la Bodleian Library en sus conjuntos de entrenamiento. Los documentos internos, obtenidos por el Guardian, confirman que en junio de 2025 la biblioteca entregó 125.000 digitalizaciones de tesis de doctorado del siglo XIX y XX, procedentes de universidades europeas y estadounidenses.
El acuerdo, anunciado públicamente en marzo de 2025, había subrayado que la finalidad principal era facilitar la digitalización de materiales raros para estudiantes y académicos. En ningún momento se especificó que los datos servirían para entrenar modelos de IA. Sin embargo, notas obtenidas mediante una solicitud de información revelan que algunos empleados de la Bodleian temían un posible daño a la reputación de Oxford y el consumo energético asociado a la IA.
Según el portavoz de la biblioteca, los escaneos son de pequeña escala, están fuera de derechos de autor y no son exclusivos de OpenAI. La institución mantiene los derechos y planea publicar los archivos en línea en los próximos meses. Además, el mismo portavoz asegura que la dimensión de entrenamiento no se ocultó: el objetivo de la digitalización era primario, pero siempre se admitió la posible reutilización para IA.
OpenAI, por su parte, argumentó que con más de mil millones de usuarios, sus sistemas deben reflejar “diferentes culturas, historias y perspectivas”. Oxford es el único miembro del Reino Unido en el consorcio NextGenAI de OpenAI, que también incluye a la Boston Public Library, Caltech, MIT y la Universidad de Michigan.
El caso llega en un contexto donde empresas de IA están adquiriendo libros impresos para crear datos de entrenamiento libres de ruido, lo que ha provocado controversia entre libreros de segunda mano. Un seguimiento realizado por 404 Media mostró que un lote de libros raros fue enviado a una instalación de Amazon que destruye libros para entrenar IA, mientras que bajo el acuerdo con la Bodleian los volúmenes permanecen intactos.
Implicaciones para la comunidad TI
Este acuerdo pone de relieve varios temas críticos para administradores y arquitectos de sistemas: la necesidad de claridad contractual sobre el uso de datos escaneados, la gestión de derechos de autor en entrenamientos de IA y la exposición a posibles críticas de sostenibilidad. Las organizaciones que consideren colaborar con proveedores de IA deberían exigir transparencia sobre la finalidad del procesamiento y evaluar el impacto energético de los modelos resultantes.
Queda pendiente observar cómo Oxford equilibrará la apertura de sus recursos digitales con la protección de su reputación y la gestión de la huella de carbono de los modelos que consumen esos datos.


