Anthropic провёл экспертную сессию по переработке конституции Claude
Ключевые выводы
- •Автор Marginal Revolution принял участие в двухдневной сессии Anthropic по пересмотру конституции Claude.
- •Anthropic применяет подход конституционного ИИ, и конституция Claude опубликована в открытом доступе с 2023 года.
- •На сессии подчёркивалась необходимость шире опираться на прецедентное право, общее право и смежные правовые рамки для управления поведением ИИ.
- •Участники обсудили систему проверки с участием разнообразных ИИ и итогового совета человеческих арбитров.
- •Anthropic ранее привлекала внешние мнения по конституции Claude, а будущие изменения найдут отражение в публичных обновлениях.

Автор экономического блога Marginal Revolution сообщает, что совсем недавно принял участие в двухдневной сессии в Anthropic, чтобы дать рекомендации по переработке конституции Claude. По словам автора, небольшая приглашённая группа была «отличной во всех отношениях», участники получили достаточно времени для общения с ключевыми лицами, принимающими решения, а сами обсуждения были очень высокого качества.
Anthropic — базирующаяся в Сан-Франциско компания в области безопасности ИИ, основанная в 2021 году бывшими исследователями OpenAI, включая генерального директора Дарио Амодеи. Claude — её ИИ-ассистент, который обучается с использованием подхода, известного как конституционный ИИ: поведение модели направляется явным письменным набором принципов. Anthropic публично опубликовала конституцию Claude, частично опираясь на такие источники, как Всеобщая декларация прав человека ООН. Метод был представлен в исследовательской работе Anthropic в декабре 2022 года, а документ появился в открытом доступе в мае 2023 года — что сделало Claude одним из немногих широко используемых ИИ-ассистентов с открыто опубликованными руководящими принципами — и эта сессия вписывается в практику, в рамках которой Anthropic привлекает внешние мнения к тексту, в том числе через публичные консультации с внешними партнёрами. Поскольку конституция определяет, как Claude отвечает огромной базе пользователей, то, как написан документ — и кто проверяет, что модель действительно ему следует, — стало актуальным вопросом в области управления ИИ.
Среди пунктов, которые, по словам автора, подчёркивались во время сессии:
- Как бы ни понимать «конституцию» в этом контексте, ей следует больше заимствовать из аналогов прецедентного права и общего права.
- В связанном с этим смысле следует думать больше в терминах «Талмуда», а не только «Торы».
- Работать над созданием качественной вторичной литературы об ИИ-конституциях и связанных документах — сейчас её не существует.
- Рассмотреть, как группа разнообразных ИИ, работающих на разных промптах, могла бы помочь оценить, в какой степени Claude и другие модели ИИ действуют в соответствии со своими конституциями.
- Учредить итоговый совет человеческих арбитров, функционирующий по аналогии с независимой судебной властью. Если у группы разнообразных ИИ возникали бы опасения, что Claude не следует своей конституции, эти ИИ могли бы уведомить человеческих арбитров о происходящем, а арбитры в таком случае обладали бы полномочиями относительно потенциальных изменений и мер исправления.
Автор также указал читателям на недавнюю короткую публикацию об использовании внутренних судов и общего права для управления и самоуправления ИИ и на дополнительные материалы о судах. В совокупности предложения сессии перенесли бы привычный юридический инструментарий — прецедент, комментарии и независимую проверку — в процесс, который, как отмечает автор, сегодня не располагает даже вторичной литературой.
В конце публикации автор благодарит Anthropic за приём группы. Любые итоговые изменения были бы видны в будущих публичных редакциях документа, который Anthropic обновляла между поколениями моделей.
Marginal Revolution, основанный в 2003 году экономистами Университета Джорджа Мейсона Тайлером Коуэном и Алексом Табарроком, — давно существующий экономический блог.
Источник: Marginal Revolution