Anthropic organizuje sesję ekspertów poświęconą przeredagowaniu konstytucji Claude’a
Najważniejsze informacje
- •Autor Marginal Revolution uczestniczył w dwudniowej sesji Anthropic poświęconej rewizji konstytucji Claude’a.
- •Anthropic stosuje constitutional AI, a konstytucja Claude’a jest publicznie dostępna od 2023 roku.
- •Sesja akcentowała większe oparcie o case law, common law i pokrewne ramy prawne w kierowaniu zachowaniem AI.
- •Uczestnicy omawiali system przeglądu obejmujący różne AI oraz końcową radę ludzkich arbitrów.
- •Anthropic wcześniej zasięgała zewnętrznych opinii na temat konstytucji Claude’a, a przyszłe zmiany miałyby być odzwierciedlane w publicznych aktualizacjach.

Autor bloga ekonomicznego Marginal Revolution podaje, że bardzo niedawno uczestniczył w dwudniowej sesji w Anthropic, aby zaoferować wskazówki dotyczące przeredagowania konstytucji dla Claude’a. Mała zaproszona grupa była — jak pisze autor — „jednolicie znakomita”, uczestnicy mieli poważny czas z kluczowymi decydentami, a dyskusje były bardzo wysokiej jakości.
Anthropic to z siedzibą w San Francisco firma zajmująca się bezpieczeństwem AI, założona w 2021 roku przez byłych badaczy OpenAI, w tym CEO Dario Amodei. Claude jest jej asystentem AI, a firma szkoli go przy użyciu podejścia znanego jako constitutional AI, w którym zachowanie modelu jest kierowane przez wyraźnie spisany zestaw zasad. Anthropic publicznie opublikowała konstytucję Claude’a, czerpiąc ją częściowo ze źródeł takich jak Powszechna Deklaracja Praw Człowieka ONZ. Metoda została przedstawiona w grudniu 2022 roku w pracy badawczej Anthropic, dokument pojawił się w internecie w maju 2023 roku — czyniąc Claude’a jednym z niewielu szeroko używanych asystentów AI, których zasady kierujące zostały publicznie ujawnione — a sama sesja wpisuje się w schemat, w którym Anthropic zabiega o zewnętrzne opinie na temat tekstu, także poprzez publiczne konsultacje prowadzone z partnerami zewnętrznymi. Ponieważ konstytucja kształtuje sposób, w jaki Claude odpowiada ogromnej bazie użytkowników, sposób napisania dokumentu — oraz to, kto weryfikuje, czy model rzeczywiście go przestrzega — stał się aktywnym zagadnieniem w ładu AI.
Wśród punktów, które według autora były akcentowane podczas sesji:
- Niezależnie od tego, co w tym kontekście można rozumieć przez „konstytucję”, powinna ona w większym stopniu czerpać z analogii do case law i common law.
- W podobnym duchu należy myśleć bardziej w kategoriach „Talmud”, a nie tylko „Torah”.
- Trzeba pracować nad zbudowaniem wysokiej jakości literatury wtórnej o konstytucjach AI i dokumentach pokrewnych — czego obecnie nie ma.
- Należy rozważyć, w jaki sposób panel zróżnicowanych AI, działających na różnych promptach, mógłby pomagać w ocenie, w jakim stopniu Claude i inne modele AI postępowały zgodnie ze swoimi konstytucjami.
- Trzeba ustanowić końcową radę ludzkich arbitrów, działającą na wzór niezależnego sądownictwa. Jeśli panel zróżnicowanych AI miałby zastrzeżenia, że Claude nie przestrzega swojej konstytucji, AI te mogłyby powiadomić ludzkich arbitrów o tym, co się dzieje, a arbitrzy mogliby następnie posiadać uprawnienia w sprawie potencjalnych zmian i środków naprawczych.
Autor wskazał też czytelnikom niedawny krótki wpis o używaniu wewnętrznych sądów i common law do pomagania w rządzeniu i samorządzeniu AI oraz dalszy tekst o sądach. Łącznie sugestie z sesji przenosiłyby znane mechanizmy prawne — precedens, komentarz i niezależny przegląd — do procesu, któremu, jak zauważa autor, dziś brakuje nawet literatury wtórnej.
Wpis kończy się podziękowaniem dla Anthropic za przyjęcie grupy. Każde wynikające z tego zmiany byłyby widoczne w przyszłych publicznych wersjach dokumentu, który Anthropic aktualizowała między generacjami modeli.
Marginal Revolution, założony w 2003 roku przez ekonomistów George Mason University Tylera Cowena i Alexa Tabarroka, jest długo działającym blogiem ekonomicznym.
Źródło: Marginal Revolution