Статья Towards AI: надежное обнаружение AI-текста сталкивается с фундаментальными ограничениями
Ключевые выводы
- •Спрос на детекторы AI-текста вырос в конце 2022 года, когда AI-системы стали способны создавать полноценные эссе и статьи.
- •Современные детекторы часто используют трансформерные классификаторы, но по-прежнему не имеют решающего правила для отделения текста, созданного AI, от человеческого письма.
- •Заявленные улучшения детекторов могут зависеть от бенчмарков и решений при обучении, которые не всегда отражают реальные условия.
- •Перефразирование и переписывание с учетом подсказок детектора могут подрывать работу инструментов обнаружения на практике.
- •Статья приходит к выводу, что учреждениям следует рассматривать оценки детекторов как слабые сигналы, а не как убедительное доказательство авторства.

Towards AI опубликовал статью, обновленную 27 июля 2026 года, в которой рассматривается, почему текст, созданный AI, по-прежнему трудно надежно распознавать, несмотря на то что школы, университеты и другие учреждения продолжают искать надежные инструменты обнаружения. Материал был первоначально опубликован на Towards AI и также доступен на Medium.
Статья посвящена классификаторам, водяным знакам и теоретическим ограничениям, лежащим в основе обнаружения AI-текста. В ней говорится, что спрос на надежные детекторы возник в конце 2022 года, когда AI-системы стали способны писать полноценные эссе и статьи без прямого участия человека в создании текста. После этого образовательные учреждения и другие организации начали искать инструменты, которые могли бы отличать машинно сгенерированный текст от человеческой работы, особенно в ситуациях, где авторство имеет академические, профессиональные или регуляторные последствия.
Согласно статье, ранние детекторы AI-текста часто опирались на простые показатели предсказуемости, такие как perplexity. Более современные системы используют обученные трансформерные классификаторы, которые преобразуют текст в пространство эмбеддингов и возвращают вероятностную оценку того, является ли фрагмент “AI” или “human”. Однако в статье отмечается, что даже эти новые модели не дают четкого правила, которое могло бы однозначно отделить текст, созданный AI, от текста, написанного человеком.
Материал утверждает, что заявленные улучшения в эффективности детекторов могут сильно зависеть от выбора бенчмарков и методов обучения. Эти решения могут приводить к появлению упрощений и смещений, из-за чего детекторы выглядят сильнее в контролируемых тестах, чем в практическом применении. В реальных условиях, говорится в статье, детекторы продолжают давать сбои при изменении условий письма и при состязательных атаках, включая перефразирование и переписывание с учетом подсказок детектора.
Автор также приводит теоретический результат, обозначенный как “потолок”. В статье говорится, что надежное обнаружение фундаментально ограничено тем, насколько похожими могут становиться распределения человеческого и AI-текста. По мере того как сгенерированный AI текст становится более связным и приближается к человеческому письму, детекторы могут смещаться к результатам, напоминающим случайное угадывание. Такая постановка делает проблему шире, чем сравнение отдельных продуктов: даже улучшенные классификаторы могут столкнуться с ограничениями, если оцениваемый ими текст больше не содержит устойчивых, выявляемых различий.
В статье также описываются практические тесты коммерческого детектора. В этих тестах автор обнаружил неожиданные ложноположительные результаты на человеческих текстах, а также неожиданные результаты для смешанных текстов, которые казались очевидными. Вывод состоит в том, что учреждениям следует рассматривать оценки детекторов только как слабые сигналы, а не как доказательство авторства, поскольку базовая проблема обнаружения, вероятно, не имеет окончательного решения.