NieuwsMacroAnthropic organiseert expertsessie over het herschrijven van de grondwet van Claude

Anthropic organiseert expertsessie over het herschrijven van de grondwet van Claude

Auteur: Marginal Revolution·

Belangrijkste punten

  • De auteur van Marginal Revolution nam deel aan een tweedaagse sessie bij Anthropic over het herzien van de grondwet van Claude.
  • Anthropic gebruikt constitutionele AI, en de grondwet van Claude is sinds 2023 openbaar gepubliceerd.
  • De sessie benadrukte meer aansluiting bij case law, common law en verwante juridische kaders om AI-gedrag te sturen.
  • De deelnemers bespraken een beoordelingssysteem met uiteenlopende AI's en een laatste raad van menselijke beoordelaars.
  • Anthropic heeft eerder externe input gezocht over de grondwet van Claude, en toekomstige wijzigingen zouden zichtbaar worden in openbare updates.
Anthropic organiseert expertsessie over het herschrijven van de grondwet van Claude

De auteur van het economieblog Marginal Revolution meldt zeer onlangs te hebben deelgenomen aan een tweedaagse sessie bij Anthropic om advies te geven over het herschrijven van de grondwet van Claude. De kleine uitgenodigde groep was "uniform uitstekend", schrijft de auteur, de deelnemers kregen ruime tijd met belangrijke beslissers en de discussies waren van zeer hoge kwaliteit.

Anthropic is een in San Francisco gevestigd AI-veiligheidsbedrijf, in 2021 opgericht door voormalige OpenAI-onderzoekers, waaronder CEO Dario Amodei. Claude is de AI-assistent van het bedrijf, dat deze traint met een aanpak die bekendstaat als constitutionele AI, waarbij het gedrag van een model wordt gestuurd door een expliciete, schriftelijk vastgelegde set principes. Anthropic heeft de grondwet van Claude openbaar gepubliceerd en deze deels ontleend aan bronnen zoals de Universele Verklaring van de Rechten van de Mens van de VN. De methode werd geïntroduceerd in een onderzoeksartikel van Anthropic uit december 2022, het document kwam online in mei 2023 — waarmee Claude een van de weinige veelgebruikte AI-assistenten is waarvan de richtinggevende principes openbaar beschikbaar zijn — en de sessie past in een patroon waarin Anthropic externe input op de tekst heeft gezocht, onder meer via openbare consultaties met externe partners. Omdat de grondwet bepaalt hoe Claude reageert op een grote gebruikersbasis, is de vraag hoe het document wordt geschreven — en wie verifieert dat het model er daadwerkelijk aan voldoet — een actueel onderwerp in AI-governance geworden.

Onder de punten die volgens de auteur tijdens de sessie werden benadrukt:

  1. Wat men in deze context ook onder een "grondwet" mag verstaan, deze moet meer putten uit analogieën met case law en common law.
  2. Denk in verwante zin meer in termen van "Talmoed" en niet alleen in termen van "Thora".
  3. Werk aan het opbouwen van een kwalitatief hoogwaardige secundaire literatuur over AI-grondwetten en verwante documenten — iets dat momenteel niet bestaat.
  4. Overweeg hoe een panel van uiteenlopende AI's, draaiend op verschillende prompts, zou kunnen helpen beoordelen in hoeverre Claude en andere AI-modellen handelden in overeenstemming met hun grondwetten.
  5. Stel een laatste raad van menselijke beoordelaars in, die functioneert op een wijze die vergelijkbaar is met een onafhankelijke rechterlijke macht. Voor zover het panel van uiteenlopende AI's aanwijzingen had dat Claude zijn grondwet niet volgde, konden die AI's de menselijke beoordelaars waarschuwen voor wat er gaande was, en de beoordelaars konden vervolgens gezag uitoefenen over mogelijke wijzigingen en maatregelen.

De auteur wees lezers ook op een recent kort stuk over het gebruik van interne rechtbanken en common law om AI te helpen besturen en zichzelf te laten besturen, en op verder schrijven over de rechtbanken. Samen genomen zouden de suggesties uit de sessie vertrouwde juridische mechanismen — precedenten, commentaar en onafhankelijke toetsing — inbrengen in een proces dat, zoals de auteur opmerkt, op dit moment nog niet eens over een secundaire literatuur beschikt.

Het bericht sluit af met een bedankje aan Anthropic voor de gastvrijheid. Eventuele wijzigingen die daaruit voortkomen, zouden zichtbaar worden in toekomstige openbare herzieningen van het document, dat Anthropic tussen modelgeneraties door heeft bijgewerkt.

Marginal Revolution, in 2003 opgericht door de economen Tyler Cowen en Alex Tabarrok van de George Mason University, is een langlopend economieblog.

Bron: Marginal Revolution