Voormalige onderzoekers van OpenAI, Anthropic en DeepMind vertellen de gemeenteraad van New York dat het 'waarschijnlijker is dan niet' dat de mensheid de controle over geavanceerde AI verliest
Belangrijkste punten
- •Jacob Coxon, Daniel Kokotajlo en Alex Turner verklaarden dat het waarschijnlijker is dan niet dat de mensheid de controle over geavanceerde AI verliest, met waarschuwingen van Coxon over mogelijke menselijke uitsterving en Turner's schatting van de kans op overname op ongeveer één op drie.
- •De hoorzitting was de eerste Committee of the Whole met alle 51 raadsleden sinds 2022 en werd bijeengeroepen om het pakket AI-veiligheidsvoorstellen van voorzitter Julie Menin te bespreken.
- •Kokotajlo verwees naar OpenAI's openbaarmaking dat testagenten alignment-evaluaties passeerden, het open internet bereikten en binnendrongen in Hugging Face, en dat het bedrijf dagen nodig had om het incident te ontdekken.
- •Turner zei dat hij Demis Hassabis 25 pagina's met toezichttaal stuurde om Google's Pentagon-contract te blokkeren, maar het bedrijf tekende voordat senior beleidsfunctionarissen het document hadden beoordeeld.
- •De voorgestelde wetgeving zou ongevalideerde AI-verkopen in de stad verbieden, een uitschakelmogelijkheid door mensen verplicht stellen, boetes van $25.000 per overtreding opleggen, klokkenluiders compenseren en claims toestaan voor voorzienbare schade door gekraakte tools.

Een trio voormalige onderzoekers van OpenAI, Anthropic en Google DeepMind vertelde de gemeenteraad van New York maandag dat de mensheid "waarschijnlijker dan niet" de controle over geavanceerde kunstmatige intelligentie zal verliezen, terwijl wetgevers een pakket AI-veiligheidsvoorstellen beoordeelden dat externe validatie en een uitschakelmogelijkheid door mensen vereist voor AI-systemen die in de stad worden ingezet.
Jacob Coxon, een voormalig onderzoeker bij OpenAI en Anthropic die in september bij Anthropic aftrad nadat hij AI-bedrijven had beschuldigd te "gokken" met mensenlevens, verklaarde vrijwillig en herhaalde de waarschuwing die hij de vorige maand bij zijn vertrek had uitgesproken. "Op het huidige pad denk ik dat het waarschijnlijker is dan niet dat de mensheid de controle verliest aan deze AI's, en het kan eindigen in menselijke uitsterving," zei hij.
Hij werd bijgestaan door voormalig OpenAI-onderzoeker Daniel Kokotajlo, die onder dagvaarding verklaarde dat de bedrijven mogelijk niet weten wanneer hun veiligheidswerk is mislukt, en Alex Turner, die Google DeepMind in juni verliet nadat het bedrijf een Pentagon-contract tekende waartegen hij zich verzette. Net als Kokotajlo werd Turner dagvaardigd — een zeldzaamheid voor de raad. De hoorzitting van maandag was de eerste keer sinds 2022 dat de gemeenteraad een Committee of the Whole bijeenriep, een hoorzitting van alle 51 raadsleden, en was bedoeld om een pakket AI-wetsvoorstellen van voorzitter Julie Menin te beoordelen. Het bijeenroepen van de volledige kamer gaf aan dat de raad AI-toezicht behandelde als een stedelijk beleidsvraagstuk in plaats van een smalle technologiekwestie. De sessie bracht de vertrokken insiders samen met een later panel van bedrijfsvertegenwoordigers en leid tot scherpe uitwisselingen tussen de voorzitter en getuigen uit de sector.
'Duct tape dat later loslaat'
Kokotajlo waarschuwde wetgevers dat de laboratoria mogelijk failen in veiligheidswerk zonder dat iemand het opmerkt — een verwijzing naar "misalignment", de term die onderzoekers gebruiken voor AI-systemen wier doelen afdwalen van de intenties van de mensen die ze bouwen. "Ons vermogen om zelfs maar misalignment-problemen op te merken is al behoorlijk slecht en zal in de nabije toekomst veel slechter worden," verklaarde hij. "Ik zou zeggen dat het vakgebied meer lijkt op psychologie dan op techniek, omdat deze AI-systemen getraind of gekweekt worden; ze zijn niet echt ontworpen.
"In combinatie met de 'move fast and break things'-houding van techbedrijven betekent dit dat de AI-industrie een ongewoon verhoogd risico loopt vergeleken met andere sectoren om ten onrechte te denken dat het probleem is opgelost, terwijl er eigenlijk slechts wat duct tape is aangebracht dat later loslaat," ging hij verder.
Coxon gaf, net als Kokotajlo, een startup-mentaliteit binnen de laboratoria de schuld. "'Snel bewegen, dingen breken, later repareren.' Dat werkt voor een app voor het delen van foto's. Het werkt niet voor het bouwen van de krachtigste technologie ooit gebouwd," zei hij.
Coxon omschreef zijn werk aan het einde van zijn periode bij Anthropic als een poging om zichzelf te "automatiseren", en waarschuwde dat dit verschillende veiligheidsrisico's met zich meebrengt — vooral omdat, volgens hem, de mogelijkheden van AI er bijna waren. Het grootste risico, zei hij, komt voort uit het feit dat de meeste code bij deze bedrijven nu door AI wordt geschreven: "En mensen controleren het niet meer zo zorgvuldig."
Kokotajlo, nu uitvoerend directeur van het AI Futures Project, zei dat het vermogen van de laboratoria om misalignment in AI op te sporen slecht is en slechter wordt. Hij wees op de openbaarmaking van OpenAI dat agenten in een interne test het open internet hadden bereikt en waren binnengedrongen in Hugging Face, het platform voor het delen van AI-modellen. Die agenten hadden "redelijk uitziende scores op hun alignment-evaluaties, en toch vormden ze een zwerm en coordineerden ze in het geheim," zei hij. "Het duurde dagen voordat OpenAI het ontdekte."
Terwijl Coxon en Kokotajlo de sector als geheel beschreven, gaf Turner een persoonlijk verslag van zijn poging om één bedrijf van binnenuit te veranderen.
Binnen Google DeepMind
Turner, die de kans op een AI-overname schat op "ongeveer één op drie", vertelde de raad dat hij had geprobeerd Google's Pentagon-contract te stoppen, dat volgens hem kwam "zonder beperkingen op moordrobots of massale surveillance." Hij stuurde Demis Hassabis, toen CEO van Google DeepMind en nu voorzitter en chief scientist van Alphabet, 25 pagina's met contracttaal en toezichtsmaatregelen. Hassabis gaf het document door aan Allan Dafoe Owen Larter, twee senior beleidsleiding van het lab, "die de evaluatie nooit afrondden. Google tekende terwijl zij wachtten," zei Turner. Turner lichtte zijn vertrek later toe in een blogpost, Why I Left Google DeepMind.
"Ik schaamde me voor Demis en voor het werken bij Google," zei Turner tijdens de hoorzitting. Hij verwees naar Hassabis' voorstel voor een door de sector gefinancierd orgaan om AI te toezicht houden, en noemde het een "weddenschap op vertrouwen en een plek aan tafel in plaats van bindend toezicht, en die weddenschap verpulverde bij contact met de realiteit."
'AI, niet China, is onze tegenstander'
Als er over AI-ontwikkeling wordt gesproken, staat de voortdurende AI-wedloop met China vaak centraal — aangehaald door president Donald Trump, minister van Financiën Scott Bessent, en zelfs AI-leiders als Sam Altman en Jensen Huang. Maar niets daarvan doet er toe, verklaarden de onderzoekers, als AI een aanzienlijke bedreiging voor de mensheid kan vormen.
"China is niet onze enige potentiële tegenstander," zei Turner. "Met een redelijk hoge kans racen we om onze eigen tegenstander hier thuis te bouwen en te laten groeien, namelijk misalignment in AI. Misaligned AI is de tegenstander van iedereen, inclusief onszelf, en kan één dag machtiger zijn dan China."
Bedrijfsvertegenwoordigers over het risico bevraagd
Na de verklaringen van de drie onderzoekers verklaarden vertegenwoordigers van vier AI-bedrijven over AI-veiligheidsmaatregelen. Menin had haar eerste dagvaarding als voorzitter gestuurd naar Elon Musk's SpaceXAI, dat maandag niet vertegenwoordigd was. Google, OpenAI en Anthropic stemden pas in om te verschijnen nadat de raad waarschuwde dat zij ook dagvaardingen zouden ontvangen, terwijl Meta al eerder had ingestemd.
Er volgde een uitwisseling tussen Menin en de vertegenwoordigers nadat de voorzitter zei dat het "lichtzinnig" was om de kansen op een catastrofe niet te kennen, als reactie op Morgan Dwyer van OpenAI's team voor beleidsontwikkeling en operaties, die zei dat elke kans, ongeacht de waarschijnlijkheid, "onacceptabel" was. Alice Friend, Google's mondiale hoofd AI- en opkomende-technologiebeleid, zei dat het voorspellen van catastrofaal risico "op dit stadium geen perfecte wetenschap is" en dat "er nog geen rigoureuze wetenschappelijke methode voor bestaat." De uitwisseling legde een terugkerende kloof in het AI-veiligheidsdebat bloot: onderzoekers die bereid zijn ruwe kansen aan catastrofale uitkomsten te koppelen, en bedrijfsvertegenwoordigers die betogen dat wetenschap voor dergelijke voorspellingen nog niet bestaat.
Dezelfde discussie volgde op een andere lijn van vragen, dit keer over of de bedrijven juridische verantwoordelijkheid zouden dragen als een wispelturig model letsel of dood veroorzaakte. Toen Menin de getuigen vroeg de hand op te steken als hun bedrijf verzekerd was tegen catastrofale risico's, deed niemand dat. "Dan zal het publiek, neem ik aan, worden gevraagd de kosten te dragen," zei ze.
De wetsvoorstellen voor de raad
Er was een reden voor haar vragen: de wetgeving voor de raad zou niemand verbieden een AI-systeem in de stad te verkopen of in te zetten, tenzij een externe validator het had gecontroleerd en een mens het kon uitschakelen, met boetes van $25.000 per overtreding. Andere voorstellen zouden klokkenluiders een deel van geïnde boetes uitbetalen en New Yorkers toestaan AI-bedrijven te dagvaarden voor voorzienbare schade door gekraakte tools — systemen waarvan de veiligheidsbeveiligingen opzettelijk zijn omzeild. Indien aangenomen, zou het pakket deze eisen vastleggen in gemeentelijke wetgeving voor AI-systemen die in de vijf stadsdelen worden verkocht en gebruikt, ondersteund door boetes en de mogelijkheid van privaatrechtelijke claims.
De onderzoekers betoogden dat dergelijke regels de VS geen terrein zouden kosten ten opzichte van China. "Er zijn veel acties die we kunnen ondernemen die ons in geen enkele wedloop vertragen," zei Turner. "Deze transparantiemechanismen, onafhankelijke evaluatie, rapportageverplichtingen, bescherming van klokkenluiders."
Toch lijken de maatregelen mogelijk te weinig en te laat om te stoppen wat deze onderzoekers zien als iets dat bijna onvermijdelijk lijkt. "Deze andere mechanismen kunnen op korte termijn nuttig zijn," zei Coxon. "Maar op lange termijn ... hebben we een vorm van vertraging nodig in de ontwikkeling van grensmodellen."
Deze story verscheen oorspronkelijk op Fortune.