OpenAI entrena sus modelos con el acervo digitalizado de la Biblioteca Bodleian de Oxford
Oxford ha permitido que OpenAI use los documentos escaneados de su Biblioteca Bodleian para ampliar los datos de entrenamiento de sus sistemas de IA.
OpenAI ha incorporado al conjunto de entrenamiento de sus modelos una gran cantidad de material digitalizado por la Biblioteca Bodleian de la Universidad de Oxford. La colaboración, anunciada en marzo de 2025, consistía inicialmente en digitalizar colecciones históricas para facilitar su consulta por estudiantes y académicos. Sin embargo, documentos internos obtenidos mediante una solicitud bajo la Ley de Libertad de Información revelan que los archivos escaneados fueron destinados explícitamente a “construir el conjunto de entrenamiento de OpenAI”.
La biblioteca, la segunda más grande del Reino Unido después de la Biblioteca Británica, entregó a OpenAI aproximadamente 125 000 páginas de tesis doctorales de los siglos XIX y XX, además de 10 000 piezas de la colección de “Broadside Ballads” del siglo XVI. Otros materiales en fase de digitalización incluyen correspondencia del novelista irlandés Maria Edgeworth y notas experimentales de Dorothy Hodgkin sobre la penicilina.
El portavoz de OpenAI defendió la iniciativa diciendo que los modelos actuales son usados por más de mil millones de personas y que “reflejar una amplia variedad de culturas, historias y perspectivas es esencial”. La universidad, por su parte, sostuvo que los documentos están fuera del plazo de protección de derechos de autor y que la licencia concedida a OpenAI es no excluyente, permitiendo a la Bodleian publicar los recursos en línea de forma independiente.
No obstante, el personal académico expresó reservas. En una acta de reunión de junio de 2025, miembros del comité de gestión de la Bodleian advirtieron sobre riesgos reputacionales y el alto consumo energético de los entrenamientos de IA, que podría contravenir los compromisos medioambientales de la universidad. Oxford es el único participante británico del proyecto “NextGenAI”, que agrupa a bibliotecas estadounidenses como la Biblioteca Pública de Boston, Caltech, MIT y la Universidad de Michigan.
Este caso plantea preguntas sobre la transparencia en el uso de datos académicos para entrenar sistemas de IA, la gestión de derechos de autor en la era digital y la responsabilidad ecológica de los grandes modelos de lenguaje. La biblioteca planea publicar los documentos digitalizados en los próximos meses, lo que ampliará el acceso público a fuentes que antes estaban limitadas a investigadores con acceso físico a Oxford.
Implicaciones para la comunidad de IA
Los desarrolladores de modelos de lenguaje deben considerar que fuentes históricas y académicas pueden estar sujetas a acuerdos implícitos de uso que no siempre se comunican abiertamente. La inclusión de material sin una clara divulgación de su propósito de entrenamiento podría generar debates sobre la ética de los datos y la necesidad de mecanismos de auditoría más robustos. Además, el consumo energético asociado a entrenar con volúmenes masivos de texto sigue siendo un factor crítico para instituciones comprometidas con la sostenibilidad.

