ИИ-компании покупают и уничтожают миллионы бумажных книг ради данных для обучения чат-ботов
Ключевые выводы
- •ИИ-компании используют анонимных посредников для оптовой покупки бумажных книг, сканируют их для обучающих данных и затем выбрасывают оригиналы.
- •Книги, выпущенные до 2023 года, особенно ценятся разработчиками ИИ, поскольку содержат только человеческий текст и не смешаны с ИИ-генерацией.
- •Книготорговцы сообщают, что еженедельные продажи выросли примерно с 20 книг до нескольких сотен из-за покупателей из сферы ИИ, но некоторые опасаются безвозвратной утраты редких названий.
- •Федеральный судья в деле Bartz v. Anthropic PBC постановил, что разрушительное сканирование законно приобретенных книг является преобразующим добросовестным использованием.
- •Суды провели правовую границу между сканированием купленных книг и использованием пиратских копий, что подтверждается урегулированием на $1.5 billion, по которому Anthropic должна компенсировать авторам, чьи пиратские работы использовались для обучения Claude.

Согласно материалу, впервые опубликованному 404 Media, компании, работающие в сфере искусственного интеллекта, анонимно скупают бумажные книги оптом, а после сканирования содержимого для обучения ИИ-моделей уничтожают оригиналы.
Книготорговцы говорят, что спрос на редкие и давно не издававшиеся названия резко вырос, и это вызывает опасения, что редкие и необычные книги безвозвратно исчезают в результате этой практики.
Федеральный судья постановил, что разрушительное сканирование законно приобретенных книг может подпадать под добросовестное использование, даже несмотря на то, что отдельные судебные споры по авторскому праву против разработчиков ИИ продолжаются.
Ниша для разрушительного сканирования
Напоминая классический антиутопический роман Fahrenheit 451, некоторые ИИ-компании не просто читают книги — они их уничтожают. По мере того как разработчики спешат создавать более мощные ИИ-модели, а иски по авторскому праву множатся, возникла небольшая отрасль, снабжающая их миллионами бумажных книг, которые разбирают, сканируют для обучающих датасетов, а затем выбрасывают.
Сообщается, что ИИ-компании используют посредников для приобретения книг в промышленном масштабе, сохраняя анонимность. Фирмы, специализирующиеся на оптовом поиске, рекламируют способность находить сотни тысяч названий, одновременно обещая конфиденциальность клиентам из сферы ИИ, что отражает чувствительность этой практики.
Критики говорят, что эта скупка продиктована стремлением ИИ-компаний сохранить знания, созданные людьми, прежде чем они будут размыты сгенерированным ИИ текстом — так называемым "AI slop". Книги, опубликованные до роста generative AI в 2023 году, считаются особенно ценными, поскольку они предоставляют высококачественные обучающие данные, написанные полностью людьми. Этот спрос отражает более широкую отраслевую проблему, иногда называемую "data wall": по мере того как общедоступный интернет-текст все больше насыщается ИИ-содержимым, разработчики обращаются к офлайн-источникам проверенного человеческого письма, чтобы сохранять качество моделей.
Перестройка рынка подержанных книг
Резкий рост спроса уже меняет рынок подержанных книг. Один неназванный книготорговец сообщил 404 Media, что еженедельные продажи выросли примерно с 20 книг до нескольких сотен после выхода на рынок покупателей из сферы ИИ. Хотя рост оказался прибыльным, торговец выразил обеспокоенность тем, что редкие и давно не издававшиеся книги окончательно теряются после сканирования и уничтожения.
"Это приносит мне финансовую выгоду, а также помогает освободить старые запасы, которые иначе вряд ли были бы проданы," — сказал книготорговец 404 Media. "Мне хорошо подходят такие продажи, потому что у меня есть ассортимент из-за рубежа и книги на иностранных языках. С другой стороны, мне не нравится конечное использование, и мне не нравится, что редкие книги отправляют в макулатуру."
Потеря физических экземпляров особенно ощутима для книг с ограниченным тиражом или тех, что так и не были оцифрованы, что поднимает вопрос о том, обязаны ли ИИ-компании сохранять артефакты, которые они используют.
Правовой прецедент: добросовестное использование при разрушительном сканировании
Эта практика напоминает "Project Panama" компании Anthropic, в рамках которого миллионы книг были оцифрованы с помощью разрушительного сканирования.
Прошлым летом в иске об авторском праве Bartz v. Anthropic PBC федеральный судья в Сан-Франциско постановил, что сканирование законно приобретенных бумажных книг в цифровые копии — даже если оригиналы были уничтожены — является преобразующим добросовестным использованием. Позднее федеральные судьи вынесли аналогичные решения о fair use в отдельных делах об авторском праве, связанных с OpenAI и Meta.
Однако в другом деле федеральный судья в том же округе на этой неделе утвердил урегулирование по авторскому праву на $1.5 billion, обязав Anthropic выплатить тысячам авторов примерно $3,000 за каждую книгу после того, как компания использовала пиратские копии их произведений для обучения Claude. Контраст между этими исходами подчеркивает правовое различие, с которым ИИ-компании теперь вынуждены тщательно считаться: покупка и сканирование физической книги могут быть защищены, а получение того же контента через пиратство — нет.
Реакция отрасли и призывы к сохранению
В ответ на растущую негативную реакцию разработчики ИИ, включая Elon Musk, выступили против этой практики и призвали компании сохранять сканируемые книги.
"Я попросил команду SpaceXAI сохранять любые редкие книги в библиотеке и сканировать их сложным способом, а не просто отрезать корешок и сканировать," — написал Musk в X.