НовостиМакроAnthropic добавит водяные знаки в контент, сгенерированный Claude, по всему миру, включая текст, отредактированный человеком

Anthropic добавит водяные знаки в контент, сгенерированный Claude, по всему миру, включая текст, отредактированный человеком

Автор: City AM Markets·

Ключевые выводы

  • Модели Claude, запущенные в ЕС начиная с 2 августа, будут включать машиночитаемые водяные знаки с момента выпуска, с планами по расширению технологии на более старые модели.
  • Водяные знаки будут применяться глобально во всех поддерживаемых продуктах Claude, а не только для пользователей в ЕС.
  • Контент, написанный человеком, но отредактированный, переведённый или вычитанный Claude, также может содержать водяной знак, даже если оригинальная работа была создана независимо.
  • Anthropic предупредила, что интенсивное перефразирование, короткие текстовые фрагменты или конвертация файлов могут сделать водяные знаки и метаданные необнаружимыми, ограничивая их надёжность как доказательства авторства ИИ.
  • Все крупные поставщики ИИ, работающие в ЕС, включая OpenAI, Google и Meta, несут сопоставимые обязательства по маркировке в соответствии с положениями о прозрачности Закона об ИИ.
Anthropic добавит водяные знаки в контент, сгенерированный Claude, по всему миру, включая текст, отредактированный человеком

Anthropic объявила о том, что начнёт встраивать невидимые водяные знаки в текст, создаваемый её моделями Claude AI, в ответ на новые требования прозрачности в рамках Закона ЕС об ИИ — первого в мире всеобъемлющего regulation в сфере ИИ. Водяные знаки призваны упростить идентификацию контента, сгенерированного ИИ, однако система также будет помечать текст, изначально написанный людьми, который впоследствии был отредактирован или обработан Claude — масштаб, способный усложнить определение того, был ли материал действительно создан ИИ.

Компания, базирующаяся в Сан-Франциско, заявила во вторник, что модели Claude, запущенные в ЕС начиная с 2 августа, будут включать машиночитаемые водяные знаки с момента выпуска. Anthropic также работает над расширением технологии на более старые модели.

Несмотря на то что водяные знаки были введены для соблюдения Закона ЕС об ИИ, Anthropic подтвердила, что маркировка будет применяться глобально везде, где доступны поддерживаемые модели Claude, включая Claude, Claude Code и платформу для разработчиков.

Текст, сгенерированный моделями, будет нести встроенный водяной знак, который, по словам Anthropic, должен сохраняться при копировании и вставке и может выдерживать определённую степень редактирования. Изображения и другие поддерживаемые типы файлов будут содержать подписанные метаданные, указывающие на то, что они были обработаны Claude.

Anthropic планирует выпустить инструменты, позволяющие пользователям и третьим сторонам обнаруживать её водяные знаки, однако технические подробности пока не раскрыты.

Это объявление прозвучало на фоне растущего давления со стороны регуляторов и издателей на ИИ-компании с требованием сделать синтетический контент более идентифицируемым после резкого роста объёмов создаваемого машинами контента в интернете. Согласно положениям о прозрачности Закона ЕС об ИИ, все крупные поставщики ИИ, работающие в блоке, включая OpenAI, Google и Meta, несут сопоставимые обязательства по маркировке ИИ-генерируемого контента, а несколько юрисдикций за пределами ЕС, включая Великобританию и отдельные штаты США, разрабатывают собственные требования к маркировке ИИ. Ранее City AM сообщала о распространении ИИ-генерируемого «мусора» в редакциях, включая колонки мнений и материалы, ошибочно представленные как работы руководителей и других авторов.

Текст, написанный человеком, также может быть помечен

Anthropic признала, что обнаружение одного из её водяных знаков не обязательно означает, что оригинальный контент был создан Claude. Пользователь может самостоятельно написать статью, а затем попросить Claude вычитать, перевести или отредактировать её — и полученный текст всё равно может содержать водяной знак Claude, даже если исходный контент и идеи принадлежат человеку.

Статья 50 Закона ЕС об ИИ устанавливает, что требования к маркировке не применяются, когда ИИ-система выполняет «вспомогательную функцию для стандартного редактирования» или не вносит существенных изменений в материал или его смысл. Anthropic присоединилась к добровольному Кодексу практической деятельности ЕС, определяющему, как компании могут соблюдать обязательства по прозрачности, однако её решение применять водяные знаки ко всем поддерживаемым результатам Claude означает, что система может охватить материал, выходящий за строгие требования законодательства.

Компания также предостерегла от использования водяных знаков как окончательного доказательства авторства ИИ. Интенсивное редактирование или перефразирование может сделать водяной знак необнаружимым, а короткие фрагменты могут содержать недостаточно текста для надёжного сигнала. Метаданные, прикреплённые к изображениям и другим файлам, также могут быть удалены при конвертации файлов или создании снимков экрана.

Технология обнаружения пока несовершенна

Алекс Цуй, технический директор компании по обнаружению ИИ GPTZero, объяснил в публикации на X, что маркировка текста водяными знаками обычно работает путём тонкого изменения вероятности выбора слов в модели, создавая статистический паттерн, который впоследствии можно обнаружить.

Однако Цуй отметил, что технология остаётся несовершенной: по его наблюдениям, водяные знаки могут не выдерживать «интенсивного перефразирования». Он также предупредил, что публичное размещение инструментов обнаружения может облегчить пользователям понимание того, как их обойти.

«Те бесплатные инструменты перефразирования, которые я пробовал, быстро обходили Google DeepMind's SynthId, насколько могу судить», — написал он.

Недавнее исследование с участием 1682 взрослых, опубликованное в журнале Judgment and Decision Making, показало, что участники оценивали истории, сгенерированные ChatGPT, как более увлекательные и более качественные, чем написанные людьми. Однако респонденты давали более высокие оценки историям, которые, как им было сказано, были написаны людьми. В двух дополнительных экспериментах исследователи не обнаружили общих доказательств того, что участники могли надёжно отличить тексты, написанные людьми, от созданных ИИ.

Anthropic заявила, что её водяной знак не будет визуально изменять результаты Claude или влиять на их смысл или читабельность. Компания признала, что система предоставляет сигнал, а не неоспоримое доказательство происхождения контента, оставляя бизнесу и издателям право самостоятельно определить, какой вес придавать новым меткам.