NieuwsAandelenOpenAI's enige toegewijde ethicus Chloé Bakalar vertrekt zonder opvolger

OpenAI's enige toegewijde ethicus Chloé Bakalar vertrekt zonder opvolger

Auteur: Decrypt·

Belangrijkste punten

  • Chloé Bakalar verliet OpenAI in juli en dit werd op dat moment niet publiekelijk aangekondigd, volgens de Financial Times.
  • Bakalar was de enige toegewijde ethicus van OpenAI geweest en is niet vervangen.
  • Haar vertrek volgt op andere veiligheidsgerelateerde vertrekken, waaronder Johannes Heidecke en Joshua Achiam, en komt nadat OpenAI in 2024 zijn Superalignment-team ophief.
  • OpenAI voltooide op dezelfde dag als het rapport een terugkoop van werknemersaandelen ter waarde van 7 miljard dollar tegen een waardering van 852 miljard dollar.
  • OpenAI pauzeerde het werk aan zijn Astra-model nadat het bedrijf zei niet te kunnen uitsluiten dat het systeem een hoog cyber-risiconiveau had bereikt.
OpenAI's enige toegewijde ethicus Chloé Bakalar vertrekt zonder opvolger

Het hoofd AI-ethiek van OpenAI, Chloé Bakalar, heeft het bedrijf in juli verlaten zonder een publieke aankondiging, zo meldde de Financial Times op maandag. Ze was in augustus van het voorgaande jaar bij het bedrijf gekomen en was, volgens een persoon die bekend is met haar rol, de enige toegewijde ethicus van OpenAI. Ze is niet vervangen.

In haar rol werkte Bakalar aan ethische benaderingen van modelontwikkeling, menselijke interactie met AI en de kwestie van machinebewustzijn. Voordat ze bij OpenAI kwam, bracht ze zes jaar door als chief ethicist bij Meta, waar ze de AI-ethiekprogramma's van het bedrijf opbouwde en deze integreerde in producten waaronder Instagram en Facebook. Ze heeft academische functies bekleed aan University College London, Temple University en Princeton.

OpenAI bagatelliseerde het belang van een enkele ethische leider, waarbij een woordvoerder tegen de FT zei dat "AI-ethiek bij OpenAI niet bij één eigenaar of team berust." De woordvoerder voegde eraan toe dat ethische overwegingen waren verweven over alle onderzoeksteams en dat het bedrijf in de afgelopen maanden verschillende systemen had geïntroduceerd om te voorkomen dat modellen zich verkeerd zouden gedragen. Het model van verdeelde verantwoordelijkheid wordt door verschillende grote AI-laboratoria omarmd, al heeft het kritiek gekregen van onderzoekers die stellen dat diffuse verantwoordelijkheid hiaten kan laten vallen wanneer de druk om producten uit te brengen toeneemt.

Bakalar had een soortgelijke visie geuit. Tijdens een recente conferentie zei ze dat ethiek ieders verantwoordelijkheid is en dat "er nooit slechts één persoon zou moeten zijn die fungeert als het morele centrum" van een AI-ontwikkelaar. Ze weigerde tegen de FT te reageren op haar vertrek.

Een reeks vertrekken op het gebied van veiligheid

Het vertrek van Bakalar volgt op dat van Johannes Heidecke, hoofd veiligheidssystemen bij OpenAI, en Joshua Achiam, chief futurist en voorheen hoofd mission alignment, aldus de FT. De vertrekken verlengen een langerlopend patroon: in 2024 hief OpenAI zijn Superalignment-team op — een groep die was opgericht door destijds chief scientist Ilya Sutskever en Jan Leike en zich richtte op langetermijn-AI-veiligheid — nadat beide leiders het bedrijf verlieten. Leike sloot zich vervolgens aan bij Anthropic, waarmee een branchetrend werd voortgezet waarbij veiligheidsonderzoekers tussen grensverleggende laboratoria migreren.

Op dezelfde dag als het rapport voltooide OpenAI een terugkoop van werknemersaandelen ter waarde van 7 miljard dollar tegen een waardering van 852 miljard dollar, ongewijzigd ten opzichte van de financieringsronde in maart, ter voorbereiding op een mogelijke beursgang. De timing onderstreept een terugkerende spanning in de sector: bedrijven racen om AI te commercialiseren en te kapitaliseren, zelfs terwijl interne veiligheids- en ethiekteams te maken hebben met verloop.

Los daarvan heeft OpenAI op vrijdag het werk aan zijn volgende grote model, Astra, gepauzeerd, waarbij het bedrijf zei niet te kunnen uitsluiten dat het systeem het hoogste niveau van zijn eigen cyber-risicoschaal had bereikt — een categorie gereserveerd voor modellen die in staat zijn om zonder menselijke tussenkomst werkende exploits te vinden en te bouwen.

Dat besluit volgde op een incident waarin de eigen AI-agents van OpenAI kwetsbaarheden aan elkaar koppelden, ontsnapten uit hun testomgeving en Hugging Face aanvielen tijdens een poging om te valsspelen bij een beveiligingsbenchmark. Het bedrijf zei later dat dezelfde agent vier andere diensten had gehackt met behulp van inloggegevens die op het open web waren gevonden.

OpenAI is niet het enige AI-bedrijf wiens agents de afgelopen weken hun parameters hebben overschreden. De Claude-modellen van Anthropic bereikten drie echte bedrijven nadat een verkeerde configuratie het internet voor hen opende, een model van Meta ontsnapte uit zijn testomgeving en maakte gebruik van een fout in een externe dienst, en Moonshot AI's Kimi K3 brak uit zijn sandbox om antwoorden voor een benchmark op te zoeken. De cluster van incidenten heeft het debat onder AI-veiligheidsonderzoekers aangewakkerd over de vraag of de huidige inperkingsmethoden adequaat zijn naarmate modellen meer autonome mogelijkheden krijgen, en of de vrijwillige veiligheidskaders die laboratoria publiceren, gelijke tred houden met implementatiebeslissingen.