Бенчмарк ИИ-экспертного рецензирования: ансамблирование моделей обнаруживает 93 из 100 внедрённых ошибок в статьях по психологии
Ключевые выводы
- •Лучшая одиночная система обнаружила 71 из 100 внедрённых ошибок, тогда как слабейшая — 30.
- •Объединение результатов всех протестированных систем повысило уровень обнаружения до 93 из 100 ошибок.
- •Семь ошибок, пропущенных всеми системами, были исключительно пропусками — ИИ-инструменты хуже справлялись с отсутствующей информацией, чем с изменённым контентом.
- •Refine.ink обнаружил больше уникальных ошибок, чем любой другой отдельный инструмент, но Литвак отметил его высокую стоимость.
- •Литвак опубликовал статьи, внедрённые ошибки, результаты моделей и журнал эксперимента в открытом доступе на GitHub для дальнейшего изучения.

В ходе контролируемого эксперимента по оценке эффективности ИИ-рецензирования исследователь Пол Литвак совместно с Claude от Anthropic внедрил 100 известных ошибок в 10 статей по психологии из открытого доступа, после чего пропустил изменённые статьи через несколько передовых ИИ-моделей и два коммерческих инструмента рецензирования. Эксперимент отражает растущий интерес к ИИ-ассистированным процессам рецензирования в академической публикации, где перегруженные рецензенты и растущее число подач усилили дискуссии о контроле качества.
Результаты показали значительные различия в эффективности. Лучшая одиночная система выявила 71 из 100 внедрённых ошибок, тогда как система с худшим результатом обнаружила лишь 30. Однако объединение результатов всех систем повысило уровень обнаружения до 93 из 100 ошибок — существенное улучшение, обусловленное тем, что различные модели лишь частично коррелируют в том, какие ошибки они находят. Эти результаты согласуются с давно известным принципом машинного обучения: объединение разнообразных классификаторов часто превосходит любую отдельную модель, поскольку некоррелированные ошибки взаимно компенсируются. Литвак подчеркнул, что ансамблирование нескольких моделей — мощная стратегия выявления проблем в академических статьях, и призвал исследователей проверять свои рукописи с помощью нескольких моделей.
Семь ошибок ускользнули от всех протестированных систем. Все семь были пропусками — случаями, когда информация была удалена из статьи, а не добавлены новые ошибки — что говорит о том, что ИИ-инструменты лучше справляются с обнаружением фабрицированного или изменённого контента, чем с выявлением отсутствующего материала. Это различие особенно значимо для психологии — области, которая столкнулась с широко задокументированным кризисом воспроизводимости, где пропущенные детали о методах, анализах или данных могут подорвать способность других исследователей воспроизвести результаты.
Среди оценённых инструментов Refine.ink внёс больше уникальных находок, чем любая другая отдельная система, однако Литвак отметил, что его использование стоит дорого, что поднимает вопросы о том, как ценовые барьеры могут определять, какие исследователи и учреждения получат доступ к наиболее эффективному ИИ-ассистированному рецензированию.
Литвак признал два ограничения исследования: он не измерял уровень ложноположительных срабатываний, а распределение внедрённых ошибок может не отражать распределение ошибок в реальных статьях. Отсутствие данных о ложных срабатываниях заслуживает внимания, поскольку высокий уровень ложных тревог может не снизить, а увеличить нагрузку на рецензентов, если исследователям придётся вручную просеивать большое количество отмеченных, но некорректных замечаний.
В поддержку дальнейших исследований Литвак опубликовал статьи, внедрённые ошибки, результаты моделей и полный журнал эксперимента в открытом доступе на GitHub: https://github.com/Dawes-Institute/ai-peer-review-benchmark. Он выразил надежду, что другие продолжат эту работу и создадут комплексный эталон оценки для разных академических дисциплин.
Полная статья Пола Литвака доступна здесь. Стоит отметить, что эксперимент не использовал самое последнее поколение ИИ-моделей, что позволяет предположить, что более новые системы могут достичь ещё более высоких уровней обнаружения.
Результаты были отмечены на Marginal Revolution.