新闻宏观经济AI同行评审基准测试:多模型集成在心理学论文中检出100个植入错误中的93个

AI同行评审基准测试:多模型集成在心理学论文中检出100个植入错误中的93个

作者: Marginal Revolution·

要点速览

  • 表现最佳的单系统检出100个植入错误中的71个,而最弱的仅检出30个。
  • 将所有受试系统的结果合并后,检出率提升至100个错误中的93个。
  • 所有系统均漏检的7个错误全部为遗漏型,表明AI工具在发现缺失信息方面比发现篡改内容更为困难。
  • Refine.ink发现了比任何其他单一工具更多的独特错误,但Litvak指出其使用成本较高。
  • Litvak在GitHub上公开发布了论文、植入的错误、模型输出和实验日志,供进一步研究使用。
AI同行评审基准测试:多模型集成在心理学论文中检出100个植入错误中的93个

在一项测试AI驱动同行评审有效性的对照实验中,研究员Paul Litvak与Anthropic的Claude合作,在10篇开放获取的心理学论文中植入了100个已知错误,随后将修改后的论文输入多个前沿AI模型和两款商业AI评审工具。该实验反映了学术界出版领域对AI辅助评审流程日益增长的兴趣——在这一领域,审稿人超负荷工作和投稿量不断攀升已使质量控制方面的争论更加激烈。

结果揭示了性能上的显著差异。表现最佳的单系统识别出100个植入错误中的71个,而表现最差的系统仅发现30个。然而,将所有系统的输出合并后,检出率提升至100个错误中的93个——这一显著改善源于不同模型在检测错误时仅存在部分相关性。合并输出所带来的提升与机器学习领域的一项长期原则一致:组合多样化的分类器往往优于任何单一模型,因为不相关的错误会相互抵消。Litvak强调,集成多个模型是识别学术论文中问题的有力策略,并鼓励研究者使用多个模型检查其稿件。

有7个错误逃过了所有测试系统的检测。这7个错误全部为遗漏型——即从论文中删除了信息,而非插入了新的错误——这表明AI工具在检测捏造或篡改内容方面仍然优于发现缺失内容。这一区别对心理学尤为重要,该领域一直面临着有据可查的可重复性危机,被遗漏的方法、分析或数据细节可能破坏其他研究者复现研究结果的能力。

在所评估的工具中,Refine.ink贡献了比任何其他单一系统更多的独特检出,尽管Litvak指出其使用成本较高,这引发了关于成本壁垒如何影响哪些研究者和机构能够获得最有效AI辅助评审的疑问。

Litvak承认研究存在两个局限性:他未测量假阳性率,且植入错误的分布可能无法反映真实论文中错误的分布。缺乏假阳性数据值得注意,因为如果研究者必须手动筛选大量被标记但实际不正确的批评意见,高误报率可能增加而非减轻审稿人的工作量。

为支持进一步研究,Litvak在GitHub上公开发布了论文、植入的错误、模型输出及完整的实验日志:https://github.com/Dawes-Institute/ai-peer-review-benchmark。他表示希望其他人能在此基础上开展工作,创建一个跨学科的综合性评估基准。

Paul Litvak的完整文章可在此处查看。值得注意的是,该实验并未使用最新一代的AI模型,这表明更新的系统可能实现更高的检出率。

该研究结果在Marginal Revolution上被报道。