IBM研究院发布BenchDrift:一款测量提示措辞如何影响LLM基准测试得分的开源工具
要点速览
- •BenchDrift测量“双向正确性翻转”,即模型的答案仅因题目改写就从正确变为错误,或相反。
- •IBM研究院在GSM8K、MMLU和MATH-Hard上测试了八个模型,发现在全部三个基准测试中都存在与措辞相关的偏移。
- •较弱的模型更可能从改写后的题目中受益,而较强的模型在提示被改写时更容易损失准确性。
- •研究人员发现,即使是高置信度的答案,也会因题目长度或风格的细微差异而发生变化。
- •IBM在GitHub上以开源形式发布了BenchDrift,包含流水线代码、笔记本和配置文件。

IBM研究院发表了一篇论文,介绍了BenchDrift——一款旨在量化大语言模型基准测试得分在测试提示被改写但含义完全不变时会产生多大偏移的开源工具。该项目为一个人人熟悉的难题给出了具体数字:有人在考试中取得高分,却在由稍作改写的题目构成的补考中失利。
BenchDrift的工作原理
其核心方法十分直接:取一道基准测试题目,在保持含义和正确答案不变的前提下进行改写,然后检验模型是否仍能答对。BenchDrift在四个不同的变化维度上系统地执行这一流程:语言、指代、语用和结构。
该工具大规模生成改写后的题目变体,然后追踪研究人员所称的“双向正确性翻转”——即仅因措辞变化,模型答案从正确变为错误、或从错误变为正确的情况。
由IBM研究院的Shailja Thakur、Sungeun An、Chad DeLuca和Hima Patel领导的研究团队,在三个广泛使用的基准测试上评估了八个模型:GSM8K(小学数学)、MMLU(大规模多任务语言理解)和MATH-Hard(高难度数学推理)。论文显示,偏移现象在所有测试中普遍存在,这表明即使底层任务没有变化,基准得分也可能对措辞十分敏感。
模型越强,问题越大
这种模式在不同能力水平的模型之间并不一致。较弱的模型往往从改写后的题目中受益,答对了此前做错的题目。而较强的模型则表现出相反的行为:即使题目的基本含义完全相同,它们在题目被改写时损失的准确性也明显更多。
研究人员还发现,高置信度的答案会随着题目长度或表述风格的微小变化而退化,这表明即使模型看似对自己的答案很有把握,这种把握也可能依附于特定措辞,而非真正的理解。
基准测试的脆弱性为何在实验室之外同样重要
BenchDrift为越来越多的证据再添一项:当前的LLM评估基础设施存在根本性缺陷。IBM此前在该领域的工作包括ITBench和BenchmarkCards项目,二者都旨在提高AI评估的透明度。BenchDrift延续了这一努力,为研究人员所称的“措辞效应”提供了量化框架——即基准得分所宣称的水平与其实际证明的水平之间可测量的差距。
这对任何利用基准测试结果来比较模型、追踪长期进展或解读细微得分差异的人都至关重要,因为对措辞的敏感性可能使这些比较不如表面看起来那样稳定。该工具已通过GitHub仓库IBM/BenchDrift开源发布,其中包括完整的流水线代码、Jupyter笔记本和配置文件,可用于生成题目变体、验证这些变体是否保持了原意,以及检测正确性偏移。