НовостиАкцииСотрудники Microsoft спрашивали, не стало ли использование данных для ИИ «крупнейшей кражей труда в истории человечества»

Сотрудники Microsoft спрашивали, не стало ли использование данных для ИИ «крупнейшей кражей труда в истории человечества»

Автор: Decrypt·

Ключевые выводы

  • Раскрытые материалы иска Times о нарушении авторских прав от 2023 года показывают, что сотрудники Microsoft в частном порядке сравнивали использование OpenAI новостных статей с беспрецедентной кражей человеческого труда и предупреждали, что обучение на сгенерированном ИИ материале может постепенно ухудшать качество моделей.
  • Генеральный директор Microsoft Сатья Наделла на допросе заявил, что платный контент должен лицензироваться, и сказал, что воспользовался бы правом Microsoft заставить OpenAI переобучить модели, если бы знал, что та использует платный материал.
  • Внутренняя переписка OpenAI включает описание сотрудником созданного обходного пути для пейволла Times, вызвавшее одобрительный ответ президента Грега Брокмана.
  • Внутренние данные OpenAI, включая наблюдение инженера о том, что пользователи редко кликают по ссылкам на источники, подрывают аргумент компаний о том, что чат-боты возвращают трафик издателям.
  • Оба ответчика настаивают на том, что обучение на новостных статьях является добросовестным использованием, в то время как судья Сидни Стайн рассматривает ходатайства об упрощенном судопроизводстве по делу, поданному Times в конце 2023 года, к которому присоединились еще одиннадцать издателей.
Сотрудники Microsoft спрашивали, не стало ли использование данных для ИИ «крупнейшей кражей труда в истории человечества»

Сотрудники Microsoft обсуждали, можно ли считать использование OpenAI новостных статей «крупнейшей кражей труда в истории человечества» и способно ли оно запустить «деградационную петлю», которая ухудшит сами модели, которые они создавали, — говорится в судебных документах, раскрытых в четверг, на которые ссылается New York Times.

Материалы относятся к иску о нарушении авторских прав, поданному Times против OpenAI и Microsoft в конце 2023 года, к которому впоследствии присоединились еще одиннадцать издателей. OpenAI на протяжении всего процесса оспаривает претензии, а судебное разбирательство уже вынудило компанию сохранить 20 миллионов логов разговоров ChatGPT. Судья Южного округа Нью-Йорка Сидни Стайн рассматривает ходатайства о вынесении решения в порядке упрощенного судопроизводства, и документы раскрываются по мере их изучения. Упрощенное судопроизводство позволяет судье разрешить дело без судебного разбирательства, когда нет подлинного спора о существенных фактах, — именно поэтому раскрытые материалы, включая внутреннюю переписку обеих компаний, имеют вес на данном этапе процесса.

Внутренние документы Microsoft от 2023 года предвидели негативную реакцию. «Миллионы людей по всему миру вскоре будут считать, что крупные модели, „выкачивающие“ всю их работу, — это поразительная ка беспрецедентных масштабов», — говорилось в одной из памяток. Тот же автор писал, что большие ИИ-модели — это «продукт, уничтожающий собственную цепочку поставок». Это замечание указывало на цикл обратной связи, в котором модели, в значительной мере обученные на сгенерированном ИИ материале, будут постепенно ухудшать собственный результат — та самая «деградационная петля», о которой говорили сотрудники.

Microsoft заявила, что памятки были написаны Брентом Хехтом, директором по прикладным наукам, который также занимал должность в Северо-Западном университете, и не отражают позицию компании. В ходатайстве компания указала, что Хехт не был лицом, принимающим решения, и был нанят, чтобы «представлять расходящиеся и асимметричные точки зрения».

«Оставляя беспорядок на ковре»

Генеральный директор Microsoft Сатья Наделла на допросе заявил, что «весь платный контент должен лицензироваться любым, кто хочет его использовать», добавив, что, если бы он знал, что OpenAI обучает модели на платном контенте, он бы воспользовался правом Microsoft заставить ее переобучить модели. Представитель компании сказал, что Наделла «говорил об общих принципах» того, как люди находят и потребляют информацию.

В OpenAI сотрудник рассказал президенту Грегу Брокману о создании «хака» для обхода пейволла Times. Брокман ответил: «ах, здорово».

Ник Тёрли, руководивший командой ChatGPT, писал в июне 2023 года, что ИИ представляет «экзистенциальную угрозу» для издателей. В феврале 2024 года он писал, что ИИ-продукты «будут становиться всё более замещающими по мере совершенствования», а в другом месте отмечал, что ИИ «продукты в значительной степени замещающие, точка».

Инженер OpenAI отметил в феврале 2023 года, что «как бы заметно мы ни показывали ссылки, пользователи по ним не кликают» — вывод, который противоречит утверждению о том, что чат-боты возвращают трафик издателям, давно являющемуся источником читателей и доходов для новостных организаций.

В памятке 2020 года Брокману и генеральному директору Сэму Альтману тогдашний директор по политике Джек Кларк предупреждал, что компания «создает системы, замещающие труд людей, которые формируют „культуру“ общества», и что она «станет символом того, как Кремниевая долина бездумно вторгается в другие сферы жизни, оставляя беспорядок на ковре». Кларк впоследствии ушел, чтобы стать сооснователем Anthropic, которая перенаправила запрос Times о комментарии в OpenAI.

И Microsoft, и OpenAI утверждают, что обучение на новостных статьях является добросовестным использованием: трансформируется в новое произведение, а не замещает оригинал. Добросовестное использование допускает ограниченное применение материала, защищенного авторским правом, без лицензии, и вопрос о том, подпадает ли под него масштабное обучение на опубликованной журналистике, является центральным юридическим вопросом, который проверит это дело.

«Мир может увидеть, что OpenAI и Microsoft всегда думали о справедливости собственного поведения», — сказал Стивен Либерман, адвокат, представляющий New York Daily News и еще семь газет в этом деле.

Times, сама являющаяся истцом, отказалась комментировать произошедшее собственным журналистам, которые сообщили, что OpenAI не ответила на запросы о комментарии. Пока ходатайства об упрощенном судопроизводстве находятся на рассмотрении, следующими вехами в деле станут решение судьи Стайна и всё, что еще вынесет в открытый доступ процесс раскрытия документов.