IBM представила BenchDrift для количественной оценки влияния формулировок на бенчмарки LLM
Ключевые выводы
- •BenchDrift измеряет "bidirectional correctness flips", когда ответ модели меняется с правильного на неправильный или наоборот только из-за перефразирования.
- •IBM Research протестировала восемь моделей на GSM8K, MMLU и MATH-Hard и обнаружила дрейф, связанный с формулировками, на всех трех бенчмарках.
- •Более слабые модели чаще выигрывали от перефразированных вопросов, тогда как более сильные чаще теряли точность при переформулировке запросов.
- •Исследователи установили, что даже ответы с высокой уверенностью могут меняться при небольших изменениях длины или стиля вопроса.
- •IBM выпустила BenchDrift как open source на GitHub вместе с кодом конвейера, notebooks и конфигурационными файлами.

IBM Research опубликовала работу, в которой представлен BenchDrift — open-source инструмент, предназначенный для количественной оценки того, насколько результаты бенчмарков больших языковых моделей меняются при перефразировании тестовых запросов без изменения их смысла. Проект дает численную оценку проблеме, знакомой каждому, кто успешно сдал экзамен, а затем провалил пересдачу со слегка измененными формулировками.
Как работает BenchDrift
Базовый принцип прост: взять вопрос из бенчмарка, переформулировать его так, чтобы смысл и правильный ответ сохранились, и проверить, по-прежнему ли модель отвечает верно. BenchDrift системно применяет этот процесс по четырем отдельным осям изменений: лингвистической, референциальной, прагматической и структурной.
Инструмент генерирует перефразированные варианты в масштабе и затем отслеживает то, что исследователи называют "bidirectional correctness flips" — случаи, когда ответ модели меняется с правильного на неправильный или с неправильного на правильный исключительно из-за формулировки.
Исследовательская группа под руководством Shailja Thakur, Sungeun An, Chad DeLuca и Hima Patel из IBM Research протестировала восемь моделей на трех широко используемых бенчмарках: GSM8K (математика уровня начальной школы), MMLU (massive multitask language understanding) и MATH-Hard (продвинутое математическое рассуждение). Согласно работе, дрейф проявился повсеместно, что подчеркивает: оценка бенчмарка может зависеть от формулировки даже тогда, когда сама задача не меняется.
Более сильные модели, более серьезные проблемы
Картина не была одинаковой для всех уровней возможностей. Более слабые модели, как правило, выигрывали от перефразированных вопросов, находя правильные ответы, которые ранее пропускали. Более сильные модели демонстрировали противоположное поведение: они заметно чаще теряли точность при переформулировке вопросов, хотя исходный смысл оставался идентичным.
Исследователи также выяснили, что ответы с высокой уверенностью могут ухудшаться при небольших изменениях длины вопроса или его стиля, что указывает на то, что даже когда модель кажется уверенной в своем ответе, эта уверенность может быть привязана к конкретной формулировке, а не к реальному пониманию.
Почему хрупкость бенчмарков важна за пределами лаборатории
BenchDrift дополняет растущий массив данных, указывающий на фундаментальные слабости текущей инфраструктуры оценки LLM. Среди предыдущих работ IBM в этой области — проекты ITBench и BenchmarkCards, оба направленные на повышение прозрачности в оценке ИИ. BenchDrift развивает эту линию, предлагая количественную рамку для того, что исследователи называют "wording effect" — измеряемого разрыва между тем, что заявляет результат бенчмарка, и тем, что он на самом деле демонстрирует.
Это важно для всех, кто использует результаты бенчмарков для сравнения моделей, отслеживания прогресса во времени или интерпретации небольших различий в баллах, поскольку чувствительность к формулировкам может делать такие сравнения менее стабильными, чем кажется на первый взгляд. Инструмент опубликован как open source через репозиторий GitHub IBM/BenchDrift. В релиз входят полный код конвейера, Jupyter notebooks и конфигурационные файлы, необходимые для генерации вариантов вопросов, проверки того, что эти варианты сохраняют смысл, и обнаружения дрейфа корректности.