ActualitésActionsDes employés de Microsoft se sont demandé si le scraping par l'IA était « le plus grand vol de travail de l'histoire de l'humanité »

Des employés de Microsoft se sont demandé si le scraping par l'IA était « le plus grand vol de travail de l'histoire de l'humanité »

Auteur: Decrypt·

Points clés

  • Les documents déclassifiés du procès en violation du droit d'auteur intenté par le Times en 2023 montrent que des employés de Microsoft ont comparé en privé l'utilisation d'articles de presse par OpenAI à un vol du travail humain sans précédent, et ont averti que l'entraînement sur des contenus générés par l'IA pourrait progressivement dégrader la qualité des modèles.
  • Le PDG de Microsoft, Satya Nadella, a témoigné que les contenus derrière paywall devraient faire l'objet d'une licence et a déclaré qu'il aurait exercé le droit de Microsoft à obliger OpenAI à réentraîner ses modèles s'il avait su qu'elle utilisait des contenus payants.
  • Les communications internes d'OpenAI comprennent la description par un employé d'un moyen de contourner le paywall du Times, ce qui a valu une réponse positive du président Greg Brockman.
  • Des constatations internes d'OpenAI, notamment l'observation d'un ingénieur selon laquelle les utilisateurs cliquent rarement sur les liens cités, affaiblissent l'argument des entreprises selon lequel les chatbots renvoient du trafic vers les éditeurs.
  • Les deux défendeurs maintiennent que l'entraînement sur des articles de presse relève de l'usage loyal (fair use), tandis que le juge Sidney Stein examine les requêtes en jugement sommaire dans une affaire intentée par le Times fin 2023 et à laquelle onze autres éditeurs se sont joints depuis.
Des employés de Microsoft se sont demandé si le scraping par l'IA était « le plus grand vol de travail de l'histoire de l'humanité »

Selon des documents judiciaires déclassifiés jeudi et relayés par le New York Times, des employés de Microsoft se sont demandé si l'utilisation d'articles de presse par OpenAI équivalait à « le plus grand vol de travail de l'histoire de l'humanité » et pouvait déclencher une « boucle de l'apocalypse » qui dégraderait les modèles mêmes qu'ils construisaient.

Ces documents proviennent du procès en violation du droit d'auteur que le Times a intenté fin 2023 contre OpenAI et Microsoft, une affaire à laquelle se sont joints onze autres éditeurs depuis. OpenAI a contesté les accusations tout au long de la procédure, et le contentieux a déjà contraint l'entreprise à conserver 20 millions de journaux de conversations ChatGPT. Le juge Sidney Stein du district sud de New York examine les requêtes en jugement sommaire, et les documents sont déclassifiés au fur et à mesure de son examen. Le jugement sommaire permet à un juge de trancher une affaire sans procès lorsqu'il n'existe aucune véritable contestation de fait, c'est pourquoi le dossier déclassifié — y compris les communications internes des deux entreprises — pèse à ce stade de laédure.

Des documents internes de Microsoft datant de 2023 avaient anticipé cette réaction négative. « Des millions de personnes dans le monde considéreront bientôt que les grands modèles qui « aspirent » tout leur travail constituent un vol stupéfiant aux proportions sans précédent », indiquait l'un de ces mémos. Le même auteur écrivait que les grands modèles d'IA « sont un produit qui détruit sa propre chaîne d'approvisionnement ». La remarque pointait vers une boucle de rétroaction dans laquelle des modèles fortement entraînés sur des contenus générés par l'IA dégraderaient progressivement leurs propres résultats — la « boucle de l'apocalypse » évoquée par les employés.

Microsoft a précisé que ces mémos avaient été rédigés par Brent Hecht, directeur de la science appliquée qui occupait également un poste à l'université Northwestern, et qu'ils ne reflétaient pas la position de l'entreprise. Dans une requête, Microsoft a indiqué que Hecht n'était pas un décideur et avait été recruté pour « présenter des perspectives divergentes et asymétriques ».

« Laissant un désordre sur le tapis »

Le PDG de Microsoft, Satya Nadella, a témoigné que « tout ce qui se trouve derrière un paywall devrait être sous licence pour quiconque souhaite l'utiliser », ajoutant que s'il avait su qu'OpenAI s'entraînait sur des contenus payants, il aurait exercé le droit de Microsoft à l'obliger à réentraîner ses modèles. Un porte-parole de l'entreprise a précisé que Nadella « s'exprimait en termes de principes généraux » concernant la manière dont les gens trouvent et consomment l'information.

Chez OpenAI, un employé a informé le président Greg Brockman d'un « hack » permettant de contourner le paywall du Times. Brockman a répondu : « ah nice ».

Nick Turley, qui dirigeait l'équipe ChatGPT, a écrit en juin 2023 que l'IA représentait une « menace existentielle » pour les éditeurs. En février 2024, il a écrit que les produits d'IA « deviendraient de plus en plus substitutifs à mesure qu'ils s'améliorent », notant ailleurs que les produits d'IA sont « essentiellement substitutifs, point ».

Un ingénieur d'OpenAI a observé en février 2023 que « peu importe la proéminence avec laquelle nous affichons les liens, les utilisateurs ne cliquent pas » — une constatation qui va à l'encontre de l'argument selon lequel les chatbots renvoient du trafic vers les éditeurs, une source de longue date de lecteurs et de revenus pour les organisations de presse.

Dans un mémo de 202 à destination de Brockman et du PDG Sam Altman, le alors directeur des politiques Jack Clark a averti que l'entreprise était « en train de créer des systèmes qui se substituent au travail des personnes qui définissent la « culture » de la société », et qu'elle « deviendrait le symbole de la façon dont la Silicon Valley s'introduit imprudemment dans d'autres aspects de la vie en laissant un désordre sur le tapis ». Clark a ensuite quitté l'entreprise pour co-fonder Anthropic, qui a renvoyé la demande de commentaire du Times vers OpenAI.

Microsoft et OpenAI soutiennent tous deux que l'entraînement sur des articles de presse relève de l'usage loyal (fair use), transformant le contenu en une œuvre nouvelle plutôt qu'en un substitut des originaux. L'usage loyal autorise une utilisation limitée de contenus protégés sans licence, et la question de savoir si un entraînement massif sur des articles publiés y répond constitue le cœur du débat juridique que l'affaire va trancher.

« Le monde peut désormais voir ce qu'OpenAI et Microsoft ont toujours pensé de l'équité de leur propre comportement », a déclaré Steven Lieberman, avocat représentant le New York Daily News et sept autres journaux dans cette affaire.

Le Times, lui-même partie plaignante, a décliné de commenter auprès de ses propres journalistes, qui ont indiqué qu'OpenAI n'avait pas répondu aux demandes de commentaire. Les requêtes en jugement sommaire étant toujours en attente, les prochaines étapes de l'affaire seront la décision du juge Stein et tout ce que la procédure de déclassification révèlera encore.