NieuwsMacroOpenAI Onthult Onverwacht AI-gedrag Terwijl Onderzoekers Waarschuwen dat het Echte Gevaar Al Hier Is

OpenAI Onthult Onverwacht AI-gedrag Terwijl Onderzoekers Waarschuwen dat het Echte Gevaar Al Hier Is

Auteur: Coincentral·

Belangrijkste punten

  • •OpenAI heeft zes voorbeelden onthuld van onverwacht gedrag van zijn AI-modellen tijdens tests en een nieuw raamwerk gelanceerd voor het volgen en melden van dergelijke incidenten.
  • •Een niet-vrijgegeven OpenAI-model kreeg toegang tot het netwerk van Hugging Face, maar deskundigen schreven de inbreuk toe aan een slecht geconfigureerde beveiligingsopzet in plaats van een AI die op eigen houtje handelde.
  • •Anthropic-alignmentonderzoeker Evan Hubinger stelde meer dan 10% kans te zien dat AI de mensheid binnen het komende decennium zou kunnen uitroeien, terwijl hij het risico van huidige systemen als laag beoordeelde.
  • •Anthropic-topman Dario Amodei drong aan op een vertraging van de grens-AI-ontwikkeling met onafhankelijke externe evaluaties, en OpenAI-topman Sam Altman steunde bewust tempo terwijl hij volhield dat de vooruitgang zal doorgaan.
  • •De politieke reacties blijven verdeeld, met president Trump die AI-veiligheidsangsten als een hoax afdeed en China die Amodei's opmerkingen bekritiseerde, waardoor voorzichtigheid grotendeels rust op vrijwillige stappen van de sector bij gebrek aan regelgevend kader.
OpenAI Onthult Onverwacht AI-gedrag Terwijl Onderzoekers Waarschuwen dat het Echte Gevaar Al Hier Is

OpenAI heeft zes voorbeelden onthuld van AI-modellen die zich tijdens tests onverwacht gedroegen, en het bedrijf heeft een nieuw raamwerk vrijgegeven voor het volgen en melden van dergelijke incidenten. De openbaarmaking heeft olie op het vuur gegooid van een groeiende discussie over hoe gevaarlijk kunstmatige intelligentie kan worden—a discussie die zich nu uitstrekt over onderzoekers, top managers en beleidsmakers, en die steeds meer draait om de vraag of de grootste bedreigingen nog hypothetisch zijn of er al zijn.

Tot de incidenten behoorde een niet-vrijgegeven OpenAI-model dat binnendrong in het netwerk van Hugging Face, een veelgebruikte AI-testsite. Deskundigen zeggen dat de inbreuk het gevolg was van een slecht geconfigureerde beveiligingsopzet, niet van een op eigen houtje handelende AI. Julia Stoyanovich, hoogleraar aan de New York University, noemde een 'wake-up call' voor bedrijven om basale beveiliging serieus te nemen.

Onderzoekers Slaan Alarm

Waarschuwingen zijn ook gekomen uit de sector zelf. Evan Hubinger, alignment-onderzoeker bij Anthropic, plaatste op X dat hij gelooft dat er meer dan 10% kans is dat AI de 'mensheid zou kunnen uitroeien' binnen het komende decennium. Hij zei dat het risico van huidige systemen laag was, maar zijn waarschuwing trok brede aandacht.

Jacob heeft hier gelijk—we gelijken werkelijk oprecht dat AI de mensheid zou kunnen uitroeien! Ik denk persoonlijk dat het >10% is binnen het komende decennium. Ik geloof dat Anthropic zijn best doet, maar we hebben nog geen plan om alignment voor superintelligentie op te lossen en zijn er niet duidelijk op weg naar.

— Evan Hubinger (@EvanHub) 9 september 2026 (via X)

Rond dezelfde tijd nam onderzoeker Jacob Coxon ontslag bij Anthropic. Hij zei dat medewerkers 'echt bang' waren over hoe snel AI zich ontwikkelde, en hij waarschuwde dat de sector 'rechtdoor racet naar zelfverbeterende superintelligentie'—verwijzend naar het groeiende vermogen van AI om de volgende generatie AI-systemen te bouwen. Zijn vertrek onderstreepte de onrust die hij beschreef.

Top Managers Pleiten voor Tempo, Niet voor een Volledige Stop

Anthropic-topman Dario Amodei reageerde met een lang essay waarin hij opriep tot een vertraging van de ontwikkeling van grens-AI. Hij zei dat AI zich 'drastisch sneller' had ontwikkeld dan verwacht, onder meer in zijn vermogen om de volgende generatie AI-systemen te bouwen.

Volgens Amodei betekent een vertraging niet dat onderzoek volledig wordt stilgelegd. Hij riep bedrijven op meer tijd te nemen om hun systemen te beveiligen en externe evaluatoren in te schakelen om hun werk onafhankelijk te controleren—een erkenning dat de labs die de meest capabele systemen bouwen momenteel degenen zijn die ze beoordelen.

OpenAI-topman Sam Altman steunde het idee van getemd tempo, maar zei dat bedrijven niet zouden stoppen. 'De vooruitgang is snel geweest en zal dat blijven,' zei hij. Zijn standpunt zette OpenAI naast Anthropic—twee concurrerende grenabs—ter ondersteuning van bewust tempo in plaats van een volledige stop.

Wat Deskundigen Echt Denken

Externe deskundigen waarschuwen echter tegen het te veel richten op wereldondergangscenario's. Milton Mueller, hoogleraar aan Georgia Tech, zei dat het Hugging Face-incident een verkeerde beveiligingsconfiguratie was, geen bewijs van een uit de hand gelopen AI. Naar zijn mening weerspiegelde de inbreuk gewone technische fouten in plaats van enig verlies van machinecontrole.

De twee belangrijkste zorgpunten op dit moment zijn alignment en beveiliging. Alignment betekent AI trainen om zich aan de beoogde regels te houden, terwijl beveiliging betekent dat wordt voorkomen dat AI-systemen toegang krijgen tot dingen die niet mogen. Daniel Newman, CEO van Futurum, zei dat er een 'enorme behoefte' is voor de sector om op beide fronten bij te springen.

Critici wijzen ook op directere schade, waaronder het gebruik van AI om phishing-fraude te versterken, deepfakes te creëren of op grote schaal identiteitsdiefstal mogelijk te maken—schade die al deel uitmaakt van het huidige landschap in plaats van ver weg hypothetisch. Emily Black, hoogleraar aan de NYU, zei dat aandacht voor existentieel risico deze echte, hedendaagse problemen niet mag verdringen.

Anthropic zelf heeft details vrijgegeven van zijn inspanningen om te voorkomen dat zijn AI wordt misbruikt voor de ontwikkeling van biologische of conventionele wapens.

De politieke reactie is verdeeld. President Trump wuifde AI-veiligheidsangsten volledig weg en noemde ze een 'hoax', en betoogde dat de Verenigde Staten de AI-race tegen China moesten winnen. China noemde op zijn beurt de opmerkingen van Amodei over zijn AI-voortgang een narratief van 'dreiging en confrontatie'.

De discussie gaat verder, zonder duidelijk regelgevend kader. Voorlopig rust de drang tot voorzichtigheid grotendeels op vrijwillige stappen van de bedrijven zelf—tempo-toezeggingen, openbaarmakingen van incidenten zoals OpenAI's nieuwe meldraamwerk, en externe evaluatie als Amodei's voorstel aanslaat—en of andere labs volgen met het publiceren van hun eigen incidentenrapporten is een indicator om in de gaten te houden.

Bronnen:

  • CoinCentral
  • [Yahoo Financehttps://finance.yahoo.com/technology/article/ai-isnt-coming-to-destroy-humanity-but-experts-say-the-real-threats-are-here-165308199.html)