新聞宏觀經濟AI 同儕審查基準測試:模型集成在心理學論文中找出 100 個刻意植入錯誤中的 93 個

AI 同儕審查基準測試:模型集成在心理學論文中找出 100 個刻意植入錯誤中的 93 個

作者: Marginal Revolution·

重點速覽

  • 表現最好的單一系統找出 100 個植入錯誤中的 71 個,而表現最弱的只找出 30 個。
  • 將所有受測系統的結果合併後,檢出率提升至 100 個中的 93 個錯誤。
  • 所有未被發現的 7 個錯誤都是遺漏,顯示 AI 工具較難找出缺失資訊,而非被改動的內容。
  • Refine.ink 找出比任何其他單一工具更多的獨特錯誤,但 Litvak 指出其使用成本較高。
  • Litvak 已將論文、植入錯誤、模型輸出與實驗紀錄公開於 GitHub,供進一步研究。
AI 同儕審查基準測試:模型集成在心理學論文中找出 100 個刻意植入錯誤中的 93 個

在一項用來測試 AI 驅動同儕審查有效性的受控實驗中,研究者 Paul Litvak 與 Anthropic 的 Claude 合作,在 10 篇可公開取得的心理學論文中植入 100 個已知錯誤,之後再將修改後的論文交由多個前沿 AI 模型與兩款商業 AI 審查工具處理。這項實驗反映出學術出版領域對 AI 輔助審查工作流程日益增加的關注;在審稿人工作量過重、投稿量持續上升的背景下,品質控管的討論也愈加激烈。

結果顯示各系統表現差異明顯。表現最好的單一系統辨識出 100 個植入錯誤中的 71 個,而表現最差的系統只找出 30 個。不過,將所有系統的輸出合併後,檢出率提升至 100 個中的 93 個錯誤,這種大幅改善來自於不同模型在找錯方面僅部分相關。這種合併帶來的收益,也符合機器學習中的一項長期原則:結合多樣化的分類器,往往會勝過任何單一模型,因為彼此不相關的錯誤會相互抵消。Litvak 強調,集成多個模型是找出學術論文問題的強大策略,並鼓勵研究者將自己的稿件與多個模型進行比對。

有 7 個錯誤未被任何受測系統發現。這 7 個全都是遺漏,也就是資訊從論文中被刪除,而不是新增錯誤被植入,這表示 AI 工具目前仍較擅長偵測被捏造或被改動的內容,而不是找出缺失資訊。這一差異在心理學領域尤其重要;該領域長期面臨廣為記錄的可重現性危機,若研究方法、分析或資料細節遭到省略,可能削弱其他研究者重現結果的能力。

在受評估的工具中,Refine.ink 提供了比任何其他單一系統更多的獨特發現,不過 Litvak 也指出其使用成本偏高,這引發了關於成本門檻如何影響哪些研究者與機構能接觸到最有效 AI 輔助審查工具的問題。

Litvak 承認這項研究有兩項限制:他沒有衡量誤報率,而且這些植入錯誤的分布未必能反映真實論文中的錯誤分布。缺少誤報資料尤其值得注意,因為若研究者必須手動篩選大量被標記但不正確的批評,高誤報率可能反而增加而非減輕審稿負擔。

為了支持後續研究,Litvak 已將論文、植入錯誤、模型輸出與完整實驗紀錄公開於 GitHub:https://github.com/Dawes-Institute/ai-peer-review-benchmark。他希望其他人能在這項工作基礎上,建立一個跨學科的完整評估基準。

Paul Litvak 的完整文章可在這裡閱讀。值得注意的是,這項實驗並未使用最新一代的 AI 模型,這意味著更新的系統可能會達到更高的檢出率。

這些發現也被Marginal Revolution提及。