ActualitésMacroUn chercheur d’Anthropic estime à plus de 10 % le risque que l’IA tue toute l’humanité au cours de la prochaine décennie

Un chercheur d’Anthropic estime à plus de 10 % le risque que l’IA tue toute l’humanité au cours de la prochaine décennie

Auteur: Fox Business Markets·

Points clés

  • Evan Hubinger a déclaré estimer à plus de 10 % la probabilité que l’IA tue toute l’humanité au cours de la prochaine décennie.
  • Selon Hubinger, le danger immédiat ne vient pas des modèles actuels, mais d’une superintelligence issue de l’auto-amélioration récursive.
  • Hubinger a reconnu qu’Anthropic ne disposait pas encore d’un plan pour résoudre l’alignement d’une superintelligence ni d’une trajectoire claire pour y parvenir.
  • L’ancien chercheur Jacob Coxon a démissionné d’Anthropic après avoir accusé l’entreprise et OpenAI de poursuivre de manière imprudente le développement de systèmes d’IA capables de s’améliorer eux-mêmes.
  • Coxon a déclaré qu’une interdiction temporaire de l’amélioration des capacités des modèles pourrait être nécessaire pour empêcher une course mondiale dangereuse.
Un chercheur d’Anthropic estime à plus de 10 % le risque que l’IA tue toute l’humanité au cours de la prochaine décennie

Un chercheur senior en sécurité d’Anthropic a déclaré mardi que l’intelligence artificielle avait plus de 10 % de chances de « tu[er] tous les humains » au cours de « la prochaine décennie », en réponse à un ancien employé qui a démissionné après avoir accusé l’entreprise d’agir de manière irresponsable.

L’ancien chercheur d’Anthropic et d’OpenAI Jacob Coxon a écrit dimanche, dans un long fil de démission publié sur X, que « les personnes qui développent l’IA croient sincèrement qu’elle pourrait tous nous tuer d’ici la fin de la décennie ».

« J’ai démissionné d’Anthropic aujourd’hui. J’ai consacré les trois dernières années à des recherches sur le préentraînement chez OpenAI et Anthropic. Aucune des deux entreprises n’agit de manière responsable. Elles foncent tout droit vers une superintelligence capable de s’améliorer elle-même et jouent avec nos vies », a écrit Coxon.

Evan Hubinger, responsable de la science de l’alignement chez Anthropic, a répondu au fil de Coxon dans une publication citée. Hubinger a déclaré que l’évaluation de Coxon était correcte, tout en ajoutant des réserves concernant l’origine et le calendrier du risque.

« Jacob a raison sur ce point : nous croyons réellement et sincèrement que l’IA pourrait tuer tous les humains ! » a écrit Hubinger. « Personnellement, je pense que la probabilité est supérieure à 10 % au cours de la prochaine décennie. Je crois qu’Anthropic fait de son mieux, mais nous n’avons pas encore de plan pour résoudre l’alignement d’une superintelligence et nous ne sommes clairement pas en bonne voie pour y parvenir. »

Hubinger a déclaré que le risque potentiellement mortel ne provenait pas des modèles d’IA actuels. « Pour être clair, comme nous l’indiquons dans notre dernier Risk Report, je pense que le risque lié aux modèles actuels est faible », a-t-il écrit. « Ce qui m’inquiète, c’est l’émergence d’une superintelligence issue de l’auto-amélioration récursive, qui, comme nous l’avons dit, se produit plus rapidement que nous ne le pensions. »

L’auto-amélioration désigne la capacité d’un modèle d’IA à perfectionner continuellement son propre code source ou ses méthodes d’entraînement. Coxon a précisément cité les recherches sur cette capacité comme l’une des principales raisons de sa démission.

« Il s’agira bientôt de systèmes surhumains capables de pirater n’importe quoi, de révolutionner n’importe quel domaine du jour au lendemain et d’acquérir un pouvoir et des ressources réels. Nous avons tous été témoins des progrès réalisés dans chacun de ces domaines, et ces progrès ne ralentissent pas », a écrit Coxon dans son fil sur X.

Coxon a déclaré que les scientifiques d’Anthropic comprenaient les risques liés à leurs travaux, mais continuaient d’avancer parce qu’ils craignaient qu’une entreprise moins responsable ne libère la première ces capacités potentiellement désastreuses.

« Chez Anthropic, les enjeux sont bien compris, mais ils sont engagés dans une course pour y parvenir les premiers : ils pensent que personne d’autre n’agira de manière responsable et qu’ils doivent donc le faire eux-mêmes, malgré le risque », a ajouté Coxon.

Pour éviter ce qu’il a décrit comme une catastrophe absolue, Coxon a suggéré que le monde pourrait avoir besoin d’une interdiction temporaire de l’amélioration des capacités des modèles.

« Je n’ai pas le sentiment que nous soyons en bonne voie pour empêcher une course mondiale, ce qui pourrait nécessiter des mesures coûteuses telles qu’une interdiction temporaire d’améliorer les capacités des modèles », a-t-il écrit.

Coxon a finalement exhorté les chercheurs et développeurs en IA du monde entier à réfléchir aux conséquences de leurs travaux et à agir de manière plus responsable.

« Si vous êtes chercheur dans un laboratoire, je vous exhorte à réfléchir à ce que les prochaines années seront réellement. Voulez-vous lancer un entraînement RL superintelligent sans comprendre rigoureusement son esprit ? Devriez-vous baisser la tête parce que “cela arrivera de toute façon”, ou profiter de ce moment pour appeler à des conditions différentes ? » a conclu son fil sur X.

FOX Business a sollicité Coxon, Hubinger, Anthropic et OpenAI pour obtenir davantage de commentaires.