Meta 發布 GAMUT 基準,用於評估多模態 AI 的事實完整性
重點速覽
- •GAMUT 是 Meta AI 推出的新基準,專門衡量事實完整性——即 AI 回應是否包含所有相關資訊——而不只是偵測錯誤或幻覺式陳述。
- •該基準包含 1,813 個以十個領域穿戴式影像為基礎的問題,每個問題都搭配經專家驗證的評分規準,並結構化為二元、可由機器評分的檢查清單。
- •Meta 使用 GAMUT 評估了 14 個 AI 模型,其中得分最高的 Gemini 3.1 Pro 僅達到 58.7%,顯示該基準的難度以及目前模型在事實完整性方面的限制。
- •該基準展現出很強的區辨能力,能有效區分表現較強與較弱的模型。
- •Meta 已在 Hugging Face 上公開提供 GAMUT 資源,供其他研究人員和開發者評估自己的模型。

Meta AI 研究人員推出了 GAMUT,這是一項新的基準,旨在評估多數現有評測往往忽略的 AI 表現面向:事實完整性。雖然 TruthfulQA、FEVER 和 HaluEval 等廣泛使用的事實性基準著重於偵測錯誤或幻覺式陳述,但它們通常不衡量模型答案是否遺漏相關資訊。GAMUT 透過測試 AI 系統是否包含一個完整答案應具備的所有相關事實,來填補這項缺口。
該基準的全名是 Grounded Assessment of Multimodal Factuality,並在 2026 年 7 月 21 日發布的一篇 arXiv 論文中詳述。它採用結構化、基於評分規準的系統,將「AI 是否涵蓋所有必要資訊」這一問題轉化為二元、可由機器評分的檢查清單。
GAMUT 如何運作
GAMUT 透過兩層式後設評分規準框架處理資訊遺漏問題。該系統以階層方式組織所需內容——不只是列出答案應包含的事實,而是依重要性與類別加以結構化。這些要求隨後會被轉換為是或否的問題,讓語言模型能夠一致且可靠地評分。
該基準包含 1,813 個問題,這些問題以橫跨十個不同領域的真實穿戴式影像為基礎。每個問題都搭配經專家驗證的評分規準,由人類專家在任何 AI 模型接受評估前,先定義完整答案的判準。
模型表現結果
Meta 使用 GAMUT 基準評估了 14 個不同的 AI 模型。得分最高的模型是 Gemini 3.1 Pro,達到 58.7%——這一結果凸顯了該基準的難度,以及目前模型能力與完整事實完整性之間的差距。
研究人員表示,GAMUT 在受測模型之間展現出很強的區辨能力,意味著它能有效區分表現較強與較弱的模型,而不是產生集中或難以區分的分數。
Meta 已透過 Hugging Face 公開提供該基準資源,使其他研究人員和開發者能夠依據相同評分規準評估自己的模型。
對多模態 AI 評估的意義
GAMUT 的多模態設計為其評估增加了一個關鍵面向。由於該基準的問題建立在穿戴式影像之上,參與模型必須解讀視覺輸入並生成全面的文字回應,同時測試視覺理解能力與產生事實完整答案的能力——隨著 AI 助理被整合至智慧眼鏡和其他穿戴式平台等裝置,這些能力正變得愈來愈相關。Meta 本身銷售 Ray-Ban Meta 智慧眼鏡,使視覺問答中的事實完整性不只是純學術指標,而是具有實務意義的問題。