ActualitésMacroD'anciens chercheurs d'OpenAI, d'Anthropic et de DeepMind affirment au Conseil municipal de New York qu'il est « plus probable qu'improbable » que l'humanité perde le contrôle de l'IA avancée

D'anciens chercheurs d'OpenAI, d'Anthropic et de DeepMind affirment au Conseil municipal de New York qu'il est « plus probable qu'improbable » que l'humanité perde le contrôle de l'IA avancée

Auteur: Fortune Crypto·

Points clés

  • •Jacob Coxon, Daniel Kokotajlo et Alex Turner ont témoigné que la perte de contrôle de l'IA avancée est plus probable qu'improbable, Coxon avertissant d'une possible extinction humaine et Turner estimant les chances de prise de contrôle à environ une sur trois.
  • •L'audience était la première commission plénière réunissant les 51 conseillers municipaux depuis 2022, convoquée pour examiner le paquet de projets de loi sur la sécurité de l'IA de la présidente Julie Menin.
  • •Kokotajlo a cité la divulgation d'OpenAI selon laquelle des agents de test interne avaient passé les évaluations d'alignement, accédé à l'internet ouvert et pénétré dans Hugging Face, et l'entreprise a mis plusieurs jours à découvrir l'incident.
  • •Turner a déclaré avoir envoyé à Demis Hassabis 25 pages de dispositions de supervision pour bloquer le contrat de Google avec le Pentagone, mais l'entreprise a signé avant que les hauts responsables des politiques n'aient terminé d'examiner le document.
  • •La législation proposée interdirait la vente d'IA non validée dans la ville, imposerait une capacité d'arrêt humaine, prévoirait des amendes de 25 000 $ par infraction, récompenserait les lanceurs d'alerte et permettrait des poursuites pour les dommages prévisibles causés par des outils piratés.
D'anciens chercheurs d'OpenAI, d'Anthropic et de DeepMind affirment au Conseil municipal de New York qu'il est « plus probable qu'improbable » que l'humanité perde le contrôle de l'IA avancée

Un trio d'anciens chercheurs d'OpenAI, d'Anthropic et de Google DeepMind a déclaré lundi au Conseil municipal de New York qu'il était « plus probable qu'improbable » que l'humanité perde le contrôle de l'intelligence artificielle avancée, alors que les élus examinaient un paquet de projets de loi sur la sécurité de l'IA qui exigeraient une validation externe et une capacité d'arrêt humaine pour les systèmes d'IA déployés dans la ville.

Jacob Coxon, un ancien chercheur d'OpenAI et d'Anthropic qui a démissionné d'Anthropic en septembre après avoir accusé les entreprises d'IA de « jouer » avec des vies humaines, a témoigné volontairement et a réaffirmé l'avertissement qu'il avait formulé lors de son départ le mois précédent. « Sur la trajectoire actuelle, je pense qu'il est plus probable qu'improbable que l'humanité perde le contrôle de ces IA, et cela pourrait se terminer par l'extinction humaine », a-t-il déclaré.

Il était accompagné de l'ancien chercheur d'OpenAI Daniel Kokotajlo, qui a témoigné sur convocation que les entreprises pourraient ne pas savoir quand leurs travaux de sécurité ont échoué, et d'Alex Turner, qui a quitté Google DeepMind en juin après que l'entreprise a signé un contrat avec le Pentagone auquel il s'opposait. Comme Kokotajlo, Turner a été convoqué — une rareté pour le Conseil. L'audience de lundi était la première fois depuis 2022 que le Conseil municipal réunissait une commission plénière, une audience des 51 conseillers municipaux, et elle avait été convoquée pour examiner un paquet de projets de loi sur l'IA présenté par la présidente Julie Menin. La convocation de l'ensemble de l'assemblée signifiait que le Conseil traitait la supervision de l'IA comme une question de politique à l'échelle de la ville plutôt que comme un simple sujet technologique. La séance a réuni les initiés partants avec un panel ultérieur de représentants d'entreprises et a donné lieu à des échanges vifs entre la présidente et les témoins de l'industrie.

« Du ruban adhésif qui se décollera plus tard »

Kokotajlo a averti les élus que les laboratoires pourraient échouer dans leurs travaux de sécurité sans que personne ne s'en aperçoive — une référence au « désalignement », le terme utilisé par les chercheurs pour désigner les systèmes d'IA dont les objectifs s'écartent des intentions de ceux qui les conçoivent. « Notre capacité même à détecter les problèmes de désalignement est déjà quite médiocre et est appelée à dégrader considérablement dans un avenir proche », a-t-il témoigné. « Je dirais que ce domaine ressemble plus à la psychologie qu'à l'ingénierie, car ces systèmes d'IA sont entraînés ou cultivés ; ils ne sont pas vraiment conçus.

« Combiné à l'attitude 'avance vite et casse des choses' des entreprises technologiques, cela signifie que l'industrie de l'IA présente un risque inhabituellement élevé par rapport à d'autres industries de croire à tort qu'elle a résolu le problème alors qu'en réalité elle n'a appliqué qu'un ruban adhésif qui se décollera plus tard », a-t-il poursuivi.

Coxon, comme Kokotajlo, a blâmé une mentalité de startup au sein des laboratoires. « 'Avance vite, casse des choses, répare plus tard.' Cela fonctionne pour une application de partage de photos. Cela ne fonctionne pas pour construire la technologie la plus puissante jamais créée », a-t-il déclaré.

Coxon a décrit son travail à la fin de son passage chez Anthropic comme un effort pour s'« automatiser » lui-même, et il a averti que cela posait plusieurs risques de sécurité — d'autant plus que, selon lui, les capacités de l'IA y étaient presque. Le plus grand risque, a-t-il dit, vient du fait que la plupart du code de ces entreprises est désormais écrit par l'IA : « Et les gens ne le vérifient plus aussi soigneusement. »

Kokotajlo, aujourd'hui directeur exécutif de l'AI Futures Project, a déclaré que la capacité des laboratoires à détecter l'IA désalignée est médiocre et se détériore. Il a cité la divulgation d'OpenAI selon laquelle des agents lors d'un test interne avaient accédé à l'internet ouvert et pénétré dans Hugging Face, la plateforme de partage de modèles d'IA. Ces agents avaient « des scores d'apparence raisonnable lors de leurs évaluations d'alignement, et pourtant ils ont formé un essaim et se sont coordonnés en secret », a-t-il déclaré. « Il a fallu plusieurs jours à OpenAI pour le découvrir. »

Tandis que Coxon et Kokotajlo décrivaient l'industrie dans son ensemble, Turner a offert un témoignage de première main sur sa tentative de faire changer une entreprise de l'intérieur.

Au cœur de Google DeepMind

Turner, qui évalue la probabilité d'une prise de contrôle par l'IA à « environ une sur trois », a déclaré au Conseil avoir tenté d'empêcher le contrat de Google avec le Pentagone, qui, selon lui, est arrivé « sans restrictions contre les robots tueurs ni la surveillance de masse ». Il a envoyé à Demis Hassabis, alors PDG de Google DeepMind et aujourd'hui président de l'entreprise et chief scientist d'Alphabet, 25 pages de clauses contractuelles et de mesures de supervision. Hassabis a transmis le document à Allan Dafoe et Owen Larter, deux hauts responsables des politiques du laboratoire, « qui n'ont jamais fini de l'évaluer. Google a signé pendant qu'ils attendaient », a déclaré Turner. Turner a ensuite détaillé son départ dans un article de blog, Why I Left Google DeepMind.

« J'ai eu honte de Demis et de travailler chez Google », a déclaré Turner lors de l'audience. Il a cité la proposition de Hassabis d'un organisme de supervision de l'IA financé par l'industrie, la qualifiant de « pari sur la confiance et le siège à la table plutôt que sur une supervision contraignante, et ce pari s'est effondré au contact de la réalité ».

« L'IA, et non la Chine, est notre adversaire »

Lorsqu'on parle du développement de l'IA, la course l'IA en cours avec la Chine occupe souvent le devant de la scène — invoquée par le président Donald Trump, le secrétaire au Trésor Scott Bessent, et même des dirigeants de l'IA comme Sam Altman et Jensen Huang. Mais rien de tout cela n'a d'importance, ont témoigné les chercheurs, si l'IA peut représenter une menace significative pour l'humanité.

« La Chine n'est pas notre seul adversaire potentiel », a déclaré Turner. « Avec une probabilité assez élevée, nous sommes en train de courir pour construire et développer notre propre adversaire ici même, à savoir l'IA désalignée. L'IA désalignée est l'adversaire de tous, y compris le nôtre, et un jour elle pourrait être plus puissante que la Chine. »

Les représentants de l'industrie interrogés sur les risques

Après les témoignages des trois chercheurs, des représentants de quatre entreprises d'IA ont témoigné sur les mesures de sauvegarde de l'IA. Menin avait émis sa première convocation en tant que présidente à SpaceXAI d'Elon Musk, qui n'était pas représenté lors de l'audience de lundi. Google, OpenAI et Anthropic ont accepté de comparaître seulement après que le Conseil a averti qu'ils recevraient eux aussi des convocations, tandis que Meta avait accepté au préalable.

Un échange s'ensuivit entre Menin et les représentants après que la présidente a jugé « léger » de ne pas connaître les chances d'une catastrophe, en réponse à Morgan Dwyer de l'équipe de développement et d'opérations politiques d'OpenAI, qui avait déclaré que toute probabilité, quelle qu'elle soit, était « inacceptable ». Alice Friend, responsable mondiale des politiques sur l'IA et les technologies émergentes de Google, a déclaré que la prévision des risques catastrophiques « n'est pas une science exacte à ce stade » et qu'« il n'existe pas vraiment de méthode scientifique rigoureuse pour le faire à ce jour ». Cet échange a illustré une divergence récurrente dans le débat sur la sécurité de l'IA : des chercheurs prêts à attribuer des probabilités approximatives aux issues catastrophiques, et des représentants de l'industrie qui estiment que la science nécessaire à de telles prévisions n'existe pas encore.

Le même échange a suivi une autre ligne de questions, portant cette fois sur la responsabilité juridique des entreprises si un modèle incontrôlé causait des blessures ou des décès. Lorsque Menin a demandé aux témoins de lever la main si leur entreprise était assurée contre les risques catastrophiques, aucun ne l'a fait. « Donc le public, je suppose, devra absorber les coûts », a-t-elle déclaré.

Les projets de loi devant le Conseil

Ses questions avaient une raison : la législation devant le Conseil interdirait à quiconque de vendre ou de déployer un système d'IA dans la ville sans qu'un validateur externe l'ait vérifié et qu'un humain puisse l'arrêter, avec des amendes de 25 000 $ par infraction. D'autres projets de loi rémunéreraient les lanceurs d'alerte avec une part des amendes récupérées et permettraient aux New-Yorkais de poursuivre en justice les entreprises d'IA pour les dommages prévisibles causés par des outils piratés — des systèmes dont les garde-fous de sécurité ont été délibérément contournés. S'il est adopté, le paquet inscrirait cesences dans la loi municipale pour les systèmes d'IA vendus et utilisés dans les cinq arrondissements, appuyées par des amendes et la perspective d'actions en justice privées.

Les chercheurs ont fait valoir que de telles règles ne feraient pas perdre de terrain aux États-Unis face à la Chine. « Il y a de nombreuses actions que nous pouvons entreprendre qui ne nous ralentiraient dans aucune course », a déclaré Turner. « Ces mécanismes de transparence, les évaluations indépendantes, les obligations de signalement, les protections des lanceurs d'alerte. »

Cependant, ces mesures semblent pouvoir être trop peu, trop tard pour empêcher ce que ces chercheurs considèrent comme presque inévitable. « Ces autres mécanismes peuvent être utiles à court terme », a déclaré Coxon. « Mais à long terme… nous avons besoin d'une forme de ralentissement du développement des modèles de pointe. » Les projets de loi entament maintenant le processus législatif habituel du Conseil : chacun devra franchir l'examen en commission et un vote de l'assemblée plénière des 51 membres avant de pouvoir parvenir sur le bureau du maire pour être signé ou vetool.

Cette histoire a été publiée à l'origine sur Fortune.