Un article publié le 26 septembre 2026 rapportait, en s’appuyant sur des documents internes à l’Université d’Oxford, que des documents numérisés de la Bodleian Libraries avaient servi à alimenter le jeu de données d’entraînement d’OpenAI. Le récit mentionnait 125 000 images de thèses partagées avec OpenAI au plus tard en juin 2025.

Ce qu’Oxford avait annoncé en mars 2025

La vidéo présente le projet de numérisation des collections de la Bodleian et montre des documents anciens passés au scanner.

Le 4 mars 2025, l’Université d’Oxford a annoncé une collaboration de cinq ans avec OpenAI et un projet pilote de numérisation de documents du domaine public conservés par les Bodleian Libraries. L’annonce présentait le projet comme un moyen de rendre des collections consultables et accessibles aux étudiants et aux chercheurs du monde entier.

Le projet pilote devait porter sur 3 500 thèses, issues de plusieurs disciplines et datées de 1498 à 1884. Ce nombre désigne des thèses ; les 125 000 rapportées en juin 2025 sont des images.

Les documents mentionnés

Le récit publié en septembre 2026 mentionnait 125 000 images de thèses historiques partagées avec OpenAI au plus tard en juin 2025. Il évoquait aussi la numérisation de 10 000 ballades imprimées du XVIe siècle.

La position d’Oxford et les réserves du personnel

Oxford a décrit les documents numérisés comme peu nombreux à l’échelle des collections, hors droit d’auteur et utilisés de manière non exclusive. L’université a également indiqué que la Bodleian conservait le droit de mettre les numérisations à disposition du public.

Le même récit faisait état de préoccupations exprimées par des membres du personnel au sujet de la réputation de l’université et des conséquences environnementales d’une technologie énergivore, au regard de ses engagements environnementaux. Oxford indiquait alors que la bibliothèque commencerait à publier les documents numérisés en libre accès sur Internet dans les mois suivants.