新聞股票IBM 研究院發布 BenchDrift:一款用於衡量提示措辭如何改變 LLM 基準測試分數的開源工具

IBM 研究院發布 BenchDrift:一款用於衡量提示措辭如何改變 LLM 基準測試分數的開源工具

作者: CryptoBriefing·

重點速覽

  • BenchDrift 衡量「雙向正確性翻轉」,即模型的答案僅因重新措辭而由對轉錯或由錯轉對的情況。
  • IBM 研究院在 GSM8K、MMLU 與 MATH-Hard 上測試了八個模型,發現三個基準測試皆出現與措辭相關的偏移。
  • 較弱的模型較可能從改寫後的題目中受益,而較強的模型在提示被重寫時則更常失去準確度。
  • 研究人員發現,即使是高信心度的答案,也可能因題目長度或風格的細微差異而改變。
  • IBM 已在 GitHub 上開源發布 BenchDrift,內含管線程式碼、筆記本與設定檔。
IBM 研究院發布 BenchDrift:一款用於衡量提示措辭如何改變 LLM 基準測試分數的開源工具

IBM 研究院發表了一篇論文,介紹 BenchDrift——一款開源工具,旨在量化大型語言模型基準測試分數在測試提示被重新措辭但語意完全不變時會產生多大偏移。這個專案為一個許多人都熟悉的問題提供了具體數字:明明在一次考試中表現出色,卻在由略微改寫的題目組成的重考中失利。

BenchDrift 的運作方式

其核心方法相當直接:取一道基準測試題目,在不改變語意與正確答案的前提下改寫,然後檢查模型是否仍能正確作答。BenchDrift 系統性地將此流程套用在四個不同的變化軸向上:語言、指涉、語用與結構。

該工具會大規模生成改寫後的題目變體,然後追蹤研究人員所稱的「雙向正確性翻轉」——即模型的答案僅因措辭而由對轉錯、或由錯轉對的情況。

由 IBM 研究院的 Shailja Thakur、Sungeun An、Chad DeLuca 與 Hima Patel 領導的研究團隊,在三個廣泛使用的基準測試上評測了八個模型:GSM8K(小學數學)、MMLU(大規模多工語言理解)與 MATH-Hard(高階數學推理)。根據論文,偏移現象全面出現,凸顯即使底層任務未變,基準測試分數仍可能對措辭相當敏感。

模型越強,問題越大

此模式在不同能力水準之間並不一致。較弱的模型往往能從改寫後的題目中受益,答對了先前答錯的題目。較強的模型則呈現相反行為:即使底層語意完全相同,當題目被重新措辭時,它們失去的準確度明顯更多。

研究人員還發現,高信心度的答案可能因題目長度或風格的微小變化而惡化,這表示即使模型看似對答案很有把握,那份確定性也可能錨定在特定措辭上,而非真正的理解。

為何基準測試的脆弱性在實驗室之外也很重要

BenchDrift 為日益增加的證據再添一筆,顯示現行的 LLM 評測基礎設施存在根本性缺陷。IBM 在此領域的既有工作包括 ITBench 與 BenchmarkCards 專案,兩者皆旨在提升 AI 評測的透明度。BenchDrift 延續了這項努力,為研究人員所稱的「措辭效應」提供了量化架構——即基準測試分數所宣稱的與其實際證明的之間可衡量的落差。

這對任何利用基準測試結果來比較模型、追蹤長期進展或解讀細微分數差距的人都很重要,因為對措辭的敏感度可能使這些比較不如表面看來穩定。該工具已透過 GitHub 儲存庫 IBM/BenchDrift 以開源形式發布,內容包括完整的管線程式碼、Jupyter 筆記本,以及生成題目變體、驗證變體語意不變並偵測正確性偏移所需的設定檔。