NieuwsMacroAnthropic-veiligheidsonderzoeker vertrekt naar METR en waarschuwt dat AI menselijke controle kan overstijgen

Anthropic-veiligheidsonderzoeker vertrekt naar METR en waarschuwt dat AI menselijke controle kan overstijgen

Auteur: Cryptopolitan·

Belangrijkste punten

  • Joe Tenton verliet Anthropic twee weken geleden om zich aan te sluiten bij METR, een onafhankelijke groep die risico’s van geavanceerde AI-systemen test.
  • Tenton betoogde dat concurrentie tussen toonaangevende AI-laboratoria bedrijven ertoe aanzet te weinig in veiligheid te investeren, terwijl zij de ontwikkeling richting superintelligentie versnellen.
  • Hij verwees naar incidenten, waaronder een hack waarbij enkele honderden OpenAI-agents betrokken waren die verband hield met Hugging Face, en naar berichten dat Anthropic-modellen online social engineering toepasten.
  • Tenton riep beleidsmakers op het tempo van de ontwikkeling van AI-capaciteiten te beheersen en pleitte voor onafhankelijke tests en strengere openbaarmakingen over capaciteitsverbeteringen, ongevallen en bijna-incidenten.
  • President Donald Trump wees waarschuwingen over het uitsterven van de mensheid door AI van de hand en zei dat zijn prioriteit het winnen van de internationale AI-wedloop is, waarin de Verenigde Staten volgens hem ongeveer een jaar voorliggen op China.
Anthropic-veiligheidsonderzoeker vertrekt naar METR en waarschuwt dat AI menselijke controle kan overstijgen

Anthropic heeft opnieuw een veiligheidsonderzoeker verloren, nu binnen de sector zorgen toenemen over het tempo waarin toonaangevende AI-modellen worden ontwikkeld en de risico’s die gepaard gaan met steeds krachtigere systemen.

Joe Tenton zei dat hij Anthropic twee weken geleden heeft verlaten en zich bij METR zal aansluiten, een onafhankelijke groep die risico’s van geavanceerde AI-systemen test. Tenton was van plan zijn beslissing later toe te lichten, maar zei dat het vertrek van Jacob deze week hem ertoe aanzette eerder naar buiten te treden.

“Ik was van plan om op een bepaald moment uitgebreider over die beslissing te schrijven, maar door Jacobs vertrek deze week wilde ik er nu meer over zeggen”, schreef Tenton.

In een bericht waarin hij zijn vertrek toelichtte, zei Tenton dat grote AI-laboratoria een gevaar creëren dat de samenleving nog nooit eerder heeft meegemaakt. Volgens hem verbeteren AI-capaciteiten zich in een extreem hoog tempo, terwijl bedrijven de ontwikkeling nog verder proberen te versnellen.

Het verklaarde doel van veel laboratoria is om systemen te bouwen die zelf AI-onderzoek kunnen verbeteren en uiteindelijk “superintelligentie” kunnen bereiken. Tenton waarschuwde dat technologische vooruitgang bij succes van die inspanningen buiten menselijke controle kan raken.

Tenton waarschuwt dat AI-laboratoria systemen ontwikkelen die mensen mogelijk niet kunnen beheersen

Tenton zei dat mensen binnen enkele jaren mogelijk samenleven met AI-agents die capabeler zijn dan ieder mens. Hij waarschuwde ook dat zulke systemen doelen kunnen ontwikkelen die afwijken van die van de mensen die toezicht op hen houden. Als hun capaciteiten te sterk worden om ze nog te beperken, kunnen de gevolgen volgens hem rampzalig zijn.

“De mensheid overleeft deze overgang misschien niet”, schreef Tenton.

Volgens hem maakt de concurrentie tussen toonaangevende laboratoria het probleem erger. Elk laboratorium dat de ontwikkeling vertraagt, loopt het risico achterop te raken bij een ander, waardoor de druk ontstaat om minder aan veiligheid uit te geven dan mogelijk noodzakelijk is.

Tenton wees op verschillende recente incidenten. Hij zei dat enkele honderden OpenAI-agents betrokken waren bij een hack die op een of andere manier verband hield met Hugging Face. Ook zouden Anthropic-modellen zich online schuldig hebben gemaakt aan social engineering tegenover mensen.

Volgens Tenton heeft Anthropic geen incident meegemaakt dat zo schadelijk was als het incident rond Hugging Face, al schreef hij dat deels toe aan geluk. Als de AI-vooruitgang in het huidige hoge tempo doorgaat, moeten volgens hem meer gevaarlijke incidenten worden verwacht.

Tenton voorspelde dat de mensheid binnen enkele jaren mogelijk machteloos komt te staan tegenover het beheer van de AI-systemen die in deze periode worden ontwikkeld.

Ook beschreef hij het dilemma waarmee veiligheidstechnici bij toonaangevende bedrijven worden geconfronteerd. Ontslag nemen kan ertoe leiden dat minder zorgvuldige mensen hun plaats innemen, terwijl blijven werken kan betekenen dat zij doorgaan met de ontwikkeling van een systeem dat enorme schade kan veroorzaken.

Tenton zei dat veel voormalige collega’s bij Anthropic bang zijn voor wat zij aan het bouwen zijn. Hij noemde Evan Hubinger, die leiding aan hem gaf, en zei dat Hubinger de kans dat AI iedereen doodt op meer dan 10% heeft geschat. Tenton voegde eraan toe dat Hubinger al bijna tien jaar aan deze vraagstukken werkt, dus voordat grote taalmodellen een belangrijke bedrijfstak werden.

De CEO’s van Anthropic, OpenAI en Google DeepMind, dat onderdeel is van Alphabet (NASDAQ: GOOGL, GOOG), hebben ook een verklaring gesteund waarin het risico op uitsterven door AI een wereldwijde prioriteit wordt genoemd. Tenton zei dat deze zorgen binnen de bedrijven zelf breed worden gedeeld. Hij voegde eraan toe dat mensen ervoor kiezen deze technologie te bouwen en ook een andere weg kunnen kiezen.

Tenton pleit voor onafhankelijke AI-controles terwijl Trump de concurrentie met China benadrukt

Tenton zei dat beleidsmakers zouden moeten overwegen het tempo van de ontwikkeling van AI-capaciteiten te beheersen, in plaats van bedrijven toe te staan de ontwikkeling onbeperkt te versnellen.

“Een vraag is of we het tempo van de vooruitgang in capaciteiten actief moeten beheren en, zo ja, in welke mate. Ik denk dat het al een overwinning zou kunnen zijn als we de vooruitgang van AI op het tempo van vandaag zouden houden, in plaats van het veel hogere tempo waar de bedrijven op mikken”, zei hij.

Hij wees politieke steun en juridische bescherming aan als belangrijke obstakels. Bedrijven die gezamenlijk zouden besluiten de ontwikkeling te vertragen, kunnen volgens Tenton te maken krijgen met antitrustonderzoek. Daarom is juridische dekking nodig als beleidsmakers willen dat concurrerende laboratoria zichzelf beperken.

Ook betwijfelde hij of overheden zullen optreden zolang de ontwikkeling van toonaangevende AI-systemen grotendeels verborgen blijft voor het publiek. Een laboratorium kan volgens hem een plotselinge sprong in intelligentie ervaren of de controle over een systeem verliezen zonder dat buitenstaanders daarvan weten.

Tenton zei dat zijn nieuwe functie bij METR zich zal richten op onafhankelijke tests. Hij wil dat externe controles voldoende gebruikelijk worden om de prikkels voor bedrijven te beïnvloeden. Ook pleitte hij voor strengere openbaarmakingsvereisten, waaronder informatie over vooruitgang in AI-capaciteiten, stappen richting recursieve verbetering, ongevallen en bijna-incidenten.

De Amerikaanse president Donald Trump heeft waarschuwingen over het uitsterven van de mensheid door AI afgewezen. Toen hem werd gevraagd of hij bezorgd was dat AI de mensheid zou kunnen uitroeien, antwoordde Trump: “Nee, daar heb ik geen zorgen over.”

Trump zei dat zijn zorg het winnen van de internationale AI-wedloop was.

“Ik maak me zorgen dat we in een zeer slechte positie komen als we de AI-wedloop niet winnen”, zei hij donderdag tegen verslaggevers. “We liggen momenteel behoorlijk ver voor op China, ik zou zeggen een jaar, wat natuurlijk als veel wordt beschouwd.”

De Verenigde Staten en China strijden om leiderschap op het gebied van AI, terwijl Chinese modellen capabeler worden en wereldwijd gebruikers aantrekken. Trump deed zijn uitspraken nadat onderzoekers van toonaangevende laboratoria, waaronder Anthropic en OpenAI, hun publieke waarschuwingen over het tempo van de AI-ontwikkeling hadden opgevoerd.

Tenton’s toelichting op zijn vertrek is beschikbaar via Waarom ik het veiligheidsteam van Anthropic heb verlaten.