НовостиМакроТреть веб-страниц, опубликованных после запуска ChatGPT, демонстрируют значительные признаки авторства ИИ — исследование Pew

Треть веб-страниц, опубликованных после запуска ChatGPT, демонстрируют значительные признаки авторства ИИ — исследование Pew

Автор: Decrypt·

Ключевые выводы

  • Pew проанализировала примерно 490 000 страниц из архива Common Crawl за период с января 2021 года по июль 2026 года с помощью ИИ-детектора Open Pangram.
  • Около 10% страниц в июльском срезе за 2026 год продемонстрировали значительные признаки авторства ИИ, а для страниц, опубликованных после запуска ChatGPT, эта доля выросла до 35%.
  • Страницы в доменах .com демонстрировали признаки ИИ-авторства примерно в 10 раз чаще, чем сайты .edu и .gov, и примерно вдвое чаще, чем сайты .org.
  • В исследовании отмечается, что детектор может ошибочно классифицировать отдельные страницы, а помеченный материал мог быть создан с помощью ИИ, а не полностью сгенерирован машиной.
  • В исследовании указывается, что поисковые системы и ИИ-компании всё активнее переходят к подтверждению происхождения контента и анти-спам мерам по мере распространения написанного ИИ текста.
Треть веб-страниц, опубликованных после запуска ChatGPT, демонстрируют значительные признаки авторства ИИ — исследование Pew

Каждая десятая англоязычная веб-страница сегодня демонстрирует значительные признаки того, что она написана ИИ, согласно исследованию Pew Research Center, опубликованному в четверг. Если сузить выборку до страниц, опубликованных после запуска ChatGPT — созданного OpenAI в ноябре 2022 года, — доля подскакивает до 35%.

К таким выводам исследователи пришли, извлекая примерно 490 000 страниц из веб-архива Common Crawl за период с января 2021 года по июль 2026 года и пропуская тексты через Open Pangram — модель обнаружения ИИ. Десять процентов страниц в июльском срезе корпуса за 2026 год демонстрируют значительные признаки авторства ИИ. Выбор корпуса имеет особый вес: Common Crawl давно служит источником обучающих данных для больших языковых моделей, поэтому архив, используемый для измерения распространения ИИ в интернете, одновременно является сырьём для моделей, которые этот интернет пишут.

Неравномерный отпечаток

«Отпечаток» ИИ распределён по сети неравномерно. Страницы в доменах .com демонстрируют признаки авторства ИИ примерно в 10 раз чаще, чем страницы в доменах .edu или .gov, где показатель близок к 1%, и примерно вдвое чаще показателя 4,6% на сайтах .org. В 2021 году, до того как генеративные ИИ-инструменты получили массовое распространение, все четыре типа доменов выглядели практически одинаково.

Как исследователи Pew распознали машины

Детектор не помечает какое-либо отдельное слово или фразу, а оценивает статистические закономерности на больших массивах текста. Тем не менее с 2023 года некоторые отдельные «маркеры» стали резко чаще: длинные тире (em dash) теперь встречаются примерно вдвое чаще, оксфордская запятая — на 63% чаще, а частота «любимых» ИИ слов вроде «delve», «interplay» и «testament» выросла более чем вдвое.

«Негативный параллелизм» — конструкции вроде «it's not just X, it's Y» («это не просто X, это Y») — с 2023 года встречается почти втрое чаще, хотя Pew отмечает, что в целом он остаётся редким. Decrypt уже отслеживала эти же маркеры, а в декабре Merriam-Webster сделала это официальным, объявив «slop» словом года.

Ограничения обнаружения

Pew осторожно указывает на ограничения исследования: модели обнаружения могут ошибочно классифицировать отдельные страницы в обе стороны, а «значительные признаки авторства ИИ» не означают, что страница полностью написана машиной — значительная часть помеченного текста, вероятно, была создана с помощью ИИ, а не сгенерирована им в чистом виде.

Open Pangram разработана Pangram Labs; её детектор фигурировал и в другом исследовании, выявившем ИИ-сгенерированный текст примерно в 9% статей американских газет в этом году, включая страницы мнений таких изданий, как The New York Times.

Впрочем, со временем обнаруживать ИИ-текст может стать проще — не из-за языковых закономерностей, а благодаря самой технологии. Крупные ИИ-компании, такие как Anthropic, уже работают над отпечатками текста на уровне модели, которые позволят легко идентифицировать ИИ-текст, сводя ошибки к минимуму. Это смещает акцент на подтверждение происхождения — доказательство того, откуда взялся контент, — вместо догадок постфактум, в соответствии с тем же принципом, что лежит в основе стандарта C2PA, принятого медиа- и технологическими компаниями для прикрепления учётных данных к контенту.

Крутая линия тренда

Разрыв между доменами отражает то, кто и зачем публикует. Академические и государственные сайты проходят редакционную проверку, институциональное согласование и более медленные циклы публикации; домены .com включают всё — от новостных редакций до контентных ферм партнёрского маркетинга, штампующих страницы в темпе, который ни один человек-редактор не смог бы выдержать. Поисковые системы уже начали реагировать на этот поток: в 2024 году Google начала применять политику «scaled content abuse» («массовое злоупотребление контентом»), которая штрафует массово производимые страницы независимо от того, написаны ли они людьми или машинами.

В масштабе линия тренда остаётся крутой: доля ИИ-авторства в домене .com выросла с примерно 1% в январе 2021 года до 9,35% пять лет спустя — в одном лишь январе 2026 года.