Meta发布GAMUT基准:评估多模态AI的事实完整性
要点速览
- •GAMUT是Meta AI推出的一项新基准,专门衡量事实完整性——即AI回答是否包含所有相关信息——而非仅仅检测虚假或幻觉性陈述。
- •该基准包含基于可穿戴设备图像的1,813个问题,涵盖十个领域,每个问题都配有专家验证的评分准则,结构化为二进制、机器可评分的清单。
- •Meta对14个AI模型进行了GAMUT测试,其中得分最高的Gemini 3.1 Pro仅达到58.7%,证明了该基准的难度以及当前模型在事实完整性方面的局限性。
- •该基准显示出强大的区分能力,能够有效区分表现更强和更弱的模型。
- •Meta已在Hugging Face上公开GAMUT的资源,供其他研究人员和开发者评估各自的模型。

Meta AI研究人员推出了GAMUT,这是一项新的基准测试,旨在评估大多数现有评估方法往往忽视的一项AI性能维度:事实完整性。目前广泛使用的事实性基准测试(如TruthfulQA、FEVER和HaluEval)主要侧重于检测虚假或幻觉性陈述,但通常无法衡量模型回答是否遗漏了相关信息。GAMUT通过测试AI系统是否包含一个完整回答应涵盖的所有相关事实,填补了这一空白。
该基准的全称为多模态事实性评估基准(Grounded Assessment of Multimodal Factuality),于2026年7月21日发表的一篇arXiv论文中详细介绍。它采用基于评分准则的结构化系统,将AI是否涵盖所有必要信息这一问题转化为二进制、机器可评分的清单。
GAMUT的工作原理
GAMUT通过双层元评分准则框架来解决信息遗漏问题。该系统按层级组织所需内容——不仅仅是列出回答中应包含的事实,而是按重要性和类别进行结构化排列。随后,这些要求被转化为语言模型可以一致且可靠地评分的是非题。
该基准包含1,813个基于真实可穿戴设备图像的问题,涵盖十个不同领域。每个问题都配有专家验证的评分准则,由人类专家在任何AI模型接受评估之前定义完整回答的标准。
模型性能评估结果
Meta对14个不同的AI模型进行了GAMUT基准测试。得分最高的模型是Gemini 3.1 Pro,达到58.7%——这一结果凸显了该基准的难度,以及当前模型能力与完全事实完整性之间的差距。
研究人员表示,GAMUT在测试的各个模型中表现出强大的区分能力,意味着它能够有效区分表现更强和更弱的模型,而非产生聚集或无差异化的评分。
Meta已通过Hugging Face公开提供基准测试资源,使其他研究人员和开发者能够使用相同的评分准则评估自己的模型。
对多模态AI评估的重要意义
GAMUT的多模态设计为其评估增加了关键维度。由于该基准的问题基于可穿戴设备图像,参与评估的模型必须解读视觉输入并生成全面的文本回答,同时测试视觉理解能力和生成事实完整回答的能力——随着AI助手被整合到智能眼镜和其他可穿戴平台等设备中,这些能力变得越来越重要。Meta本身也在销售Ray-Ban Meta智能眼镜,这使得视觉问答中的事实完整性成为一个实际问题,而不仅仅是学术指标。