ActualitésActionsL'Université d'Oxford s'associe à OpenAI pour entraîner ses modèles d'IA sur les textes de la Bibliothèque Bodléienne

L'Université d'Oxford s'associe à OpenAI pour entraîner ses modèles d'IA sur les textes de la Bibliothèque Bodléienne

Auteur: CryptoBriefing·

Points clés

  • •OpenAI pourra entraîner ses modèles d'IA sur des textes historiques des Bibliothèques Bodléiennes d'Oxford dans le cadre d'un partenariat de cinq ans annoncé le 4 mars 2025.
  • •Un projet pilote lancé en février numérise environ 3 500 dissertations du domaine public datant de 1498 à 1884, dans le but de rendre les collections centenaires interrogeables et accessibles mondialement.
  • •L'accord fait partie du programme NextGenAI d'OpenAI, qui a engagé 50 millions de dollars en subventions de recherche, ressources de calcul et accès API à des institutions d'élite dont Harvard et le MIT.
  • •Oxford prévoit de déployer ChatGPT Edu dans toute l'université à partir de septembre 2025 après l'avoir testé auprès d'environ 750 utilisateurs, et des rapports de recherche en libre accès sur le projet de numérisation sont attendus début 2026.
  • •Certains membres du personnel universitaire ont soulevé des préoccupations concernant le risque réputationnel d'un partenariat avec OpenAI en raison de ses controverses sur le droit d'auteur et ses pratiques d'approvisionnement en données, même si les dissertations du pilote sont dans le domaine public.
L'Université d'Oxford s'associe à OpenAI pour entraîner ses modèles d'IA sur les textes de la Bibliothèque Bodléienne

L'Université d'Oxford a conclu un partenariat de cinq ans avec OpenAI qui permettra à l'entreprise derrière ChatGPT d'entraîner ses modèles d'IA sur des textes historiques conservés dans les Bibliothèques Bodléiennes, l'un des systèmes bibliothécaires les plus anciens et les plus renommés au monde.

Cette collaboration, annoncée le 4 mars 2025, a débuté par un projet pilote en février consacré à la numérisation d'environ 3 500 dissertations du domaine public datant de 1498 à 1884. Il s'agit de textes vieux de plusieurs siècles qui étaient auparavant largement inaccessibles à toute personne ne pouvant se rendre physiquement à Oxford, de sorte qu'une grande partie de ce matériel restait hors de portée de la communauté de recherche mondiale.

Ce que prévoit le partenariat

L'accord s'inscrit dans le programme NextGenAI d'OpenAI, qui a engagé 50 millions de dollars en subventions de recherche, ressources de calcul et accès API à un groupe d'institutions d'élite comprenant Harvard et le MIT aux côtés d'Oxford.

Pour les Bibliothèques Bodléiennes, l'objectif affiché est simple : l'enrichissement des métadonnées par l'IA et l'amélioration des services de transcription rendront les collections centenaires interrogeables et accessibles à l'échelle mondiale.

Sur le plan éducatif, Oxford prévoit de déployer ChatGPT Edu dans toute l'université à partir de septembre 2025. L'outil a déjà été testé auprès d'environ 750 utilisateurs. Les résultats de recherche du projet de numérisation sont attendus dans des rapports en libre accès d'ici début 2026, offrant aux observateurs des points de contrôle concrets pour juger si le partenariat tient ses objectifs annoncés.

Les inquiétudes du personnel

Tout le monde à Oxford ne célèbre pas cet accord. Le personnel de l'université a exprimé des préoccupations concernant le risque réputationnel d'un partenariat avec OpenAI, une entreprise qui a fait l'objet de critiques persistantes sur les questions de droit d'auteur, ses pratiques d'approvisionnement en données et sa commercialisation rapide sous la direction du PDG Sam Altman.

Les dissertations couvertes par le projet pilote sont dans le domaine public, ce qui signifie qu'aucun droit d'auteur ne s'applique. Néanmoins, l'image d'une institution académique vieille d'environ 900 ans fournissant ses collections à une entreprise d'IA à but lucratif a suscité un examen attentif.

Se pose également la question de ce que chaque partie y gagne. Oxford reçoit un soutien à la numérisation, des ressources de calcul et des outils éducatifs. OpenAI reçoit des données d'entraînement de haute qualité et sélectionnées provenant d'une source mondialement fiable, ainsi que l'endossement implicite qu'ique un partenariat avec Oxford — un endossement dont la valeur est accentuée par le fait que les pratiques de données de l'entreprise restent contestées.

La situation dans son ensemble

L'accord d'Oxford s'inscrit dans une tendance qui s'accélère dans l'enseignement supérieur. Les entreprises technologiques se tournent de plus en plus vers les institutions académiques comme sources de données, en partie parce que les données récupérées par web scraping se heurtent à des défis juridiques, et en partie parce que les corpus académiques tendent à être de meilleure qualité que le contenu moyen d'Internet.

Dans ce contexte, la façon dont seront accueillis le déploiement de ChatGPT Edu par Oxford et les rapports de numérisation sera observée par les institutions envisageant des accords similaires. L'engagement de 50 millions de dollars du programme NextGenAI, réparti entre plusieurs institutions, est substantiel mais modeste par rapport aux dépenses globales d'OpenAI, qui se chiffrent en milliards de dollars par an.