NieuwsMacroAnthropic-onderzoeker zegt dat AI binnen tien jaar meer dan 10% kans heeft om alle mensen te doden

Anthropic-onderzoeker zegt dat AI binnen tien jaar meer dan 10% kans heeft om alle mensen te doden

Auteur: Fox Business Markets·

Belangrijkste punten

  • Evan Hubinger zei dat hij de kans dat AI binnen het volgende decennium alle mensen doodt, op meer dan 10% schat.
  • Volgens Hubinger komt het directe gevaar niet van huidige modellen, maar van superintelligentie die door recursieve zelfverbetering wordt ontwikkeld.
  • Hubinger erkende dat Anthropic nog geen plan heeft om alignment voor superintelligentie op te lossen en daar niet duidelijk naartoe op koers ligt.
  • Voormalig onderzoeker Jacob Coxon nam ontslag bij Anthropic nadat hij het bedrijf en OpenAI ervan beschuldigde roekeloos zelfverbeterende AI-systemen na te streven.
  • Coxon zei dat een tijdelijk verbod op het verbeteren van modelcapaciteiten nodig kan zijn om een gevaarlijke mondiale wedloop te voorkomen.
Anthropic-onderzoeker zegt dat AI binnen tien jaar meer dan 10% kans heeft om alle mensen te doden

Een senior veiligheidsonderzoeker bij Anthropic zei dinsdag dat kunstmatige intelligentie een kans van meer dan 10% heeft om "alle mensen te doden" binnen "het volgende decennium". Hij reageerde daarmee op een voormalige medewerker die ontslag nam nadat die het bedrijf ervan had beschuldigd onverantwoordelijk te handelen.

De voormalige onderzoeker van Anthropic en OpenAI, Jacob Coxon, schreef zondag in een uitgebreide ontslagthread op X dat "de mensen die AI bouwen oprecht geloven dat het ons allemaal tegen het einde van het decennium zou kunnen doden".

"Ik heb vandaag ontslag genomen bij Anthropic. De afgelopen drie jaar heb ik bij zowel OpenAI als Anthropic onderzoek gedaan naar pretraining. Geen van beide bedrijven handelt verantwoordelijk. Ze racen rechtstreeks af op zelfverbeterende superintelligentie en gokken met ons leven", schreef Coxon.

Evan Hubinger, hoofd alignmentwetenschap bij Anthropic, reageerde in een geciteerd bericht op Coxons thread. Hubinger zei dat Coxons inschatting juist was, maar plaatste enkele kanttekeningen bij de oorsprong en timing van het risico.

"Jacob heeft hier gelijk—we geloven echt oprecht dat AI alle mensen zou kunnen doden!" schreef Hubinger. "Persoonlijk denk ik dat de kans binnen het volgende decennium >10% is. Ik geloof dat Anthropic zijn best doet, maar we hebben nog geen plan om alignment voor superintelligentie op te lossen en liggen daar niet duidelijk voor op koers."

Hubinger zei dat het mogelijk dodelijke risico niet afkomstig is van de huidige AI-modellen. "Voor alle duidelijkheid: zoals we in ons meest recente Risk Report zeggen, denk ik dat het risico van huidige modellen laag is", schreef hij. "Waar ik me zorgen over maak, is superintelligentie die ontstaat door recursieve zelfverbetering, waarvan we hebben gezegd dat die sneller plaatsvindt dan we dachten."

Zelfverbetering verwijst naar het vermogen van een AI-model om zijn eigen broncode of trainingsmethoden voortdurend te verbeteren. Coxon noemde onderzoek naar deze mogelijkheid specifiek als een belangrijke reden voor zijn ontslag.

"Dit zullen binnenkort bovenmenselijke systemen zijn die alles kunnen hacken, elk vakgebied van de ene op de andere dag kunnen revolutioneren en echte macht en middelen kunnen verwerven. We hebben allemaal de vooruitgang op elk van deze gebieden gezien, en die vooruitgang vertraagt niet", schreef Coxon in zijn X-thread.

Coxon zei dat de wetenschappers van Anthropic de risico’s van hun werk begrijpen, maar doorgaan omdat ze vrezen dat een minder verantwoordelijk bedrijf deze potentieel rampzalige mogelijkheden als eerste zou kunnen ontsluiten.

"Bij Anthropic zijn de belangen goed begrepen, maar ze zitten gevangen in een race om er als eerste te komen—ze geloven dat niemand anders verantwoordelijk zal handelen, dus moeten ze het zelf doen, ondanks het risico", voegde Coxon eraan toe.

Om te voorkomen wat hij een absolute catastrofe noemde, suggereerde Coxon dat de wereld mogelijk een tijdelijk verbod op het verbeteren van modelcapaciteiten nodig heeft.

"Ik heb niet het gevoel dat we op koers liggen om een mondiale wedloop te voorkomen, wat kostbare maatregelen kan vereisen, zoals een tijdelijk verbod op het verbeteren van modelcapaciteiten", schreef hij.

Coxon riep AI-onderzoekers en -ontwikkelaars wereldwijd uiteindelijk op om na te denken over de gevolgen van hun werk en verantwoordelijker te handelen.

"Als je onderzoeker bij een laboratorium bent, dring ik er bij je op aan om na te denken over hoe de komende jaren er daadwerkelijk uit zullen zien. Wil je een superintelligente RL-run starten zonder een grondig begrip van diens geest? Moet je je hoofd laten zakken omdat 'het toch gebeurt'—of dit moment aangrijpen om om andere omstandigheden te vragen?" zo besloot hij zijn X-thread.

FOX Business nam contact op met Coxon, Hubinger, Anthropic en OpenAI voor verder commentaar.