НовостиАкцииMeta выпустила бенчмарк GAMUT для оценки фактической полноты мультимодального ИИ

Meta выпустила бенчмарк GAMUT для оценки фактической полноты мультимодального ИИ

Автор: CryptoBriefing·

Ключевые выводы

  • GAMUT — новый бенчмарк Meta AI, который специально измеряет фактическую полноту: включают ли ответы ИИ всю релевантную информацию, а не только выявляет ложные или галлюцинированные утверждения.
  • Бенчмарк содержит 1,813 вопросов, основанных на изображениях с носимых устройств в десяти областях; каждый вопрос сопровождается проверенными экспертами рубриками, структурированными в бинарные контрольные списки, пригодные для машинной оценки.
  • Meta оценила 14 моделей ИИ с помощью GAMUT; лучший результат показала Gemini 3.1 Pro, набравшая лишь 58.7%, что демонстрирует сложность бенчмарка и текущие ограничения моделей в фактической полноте.
  • Бенчмарк показал сильную дискриминативную способность, эффективно различая более сильные и более слабые модели.
  • Meta сделала ресурсы GAMUT публично доступными на Hugging Face, чтобы другие исследователи и разработчики могли оценивать собственные модели.
Meta выпустила бенчмарк GAMUT для оценки фактической полноты мультимодального ИИ

Исследователи Meta AI представили GAMUT — новый бенчмарк, предназначенный для оценки аспекта работы ИИ, который большинство существующих тестов обычно упускают из виду: фактической полноты. Хотя широко используемые бенчмарки фактичности, такие как TruthfulQA, FEVER и HaluEval, сосредоточены на выявлении ложных или галлюцинированных утверждений, они, как правило, не измеряют, упускает ли ответ модели релевантную информацию. GAMUT устраняет этот пробел, проверяя, включает ли система ИИ все значимые факты, которые должен содержать исчерпывающий ответ.

Бенчмарк, полное название которого — Grounded Assessment of Multimodal Factuality, был подробно описан в статье arXiv, опубликованной 21 июля 2026 года. Он использует структурированную систему на основе рубрик, которая преобразует вопрос о том, охватил ли ИИ всю необходимую информацию, в бинарные контрольные списки, пригодные для машинной оценки.

Как работает GAMUT

GAMUT решает проблему пропуска информации с помощью двухуровневой мета-рубрики. Система организует требуемый контент иерархически — не просто перечисляя факты, которые должен включать ответ, а структурируя их по важности и категориям. Затем эти требования преобразуются в вопросы с ответом «да» или «нет», которые языковые модели могут оценивать последовательно и надежно.

Бенчмарк включает 1,813 вопросов, основанных на реальных изображениях с носимых устройств и охватывающих десять отдельных областей. Каждый вопрос сопровождается проверенными экспертами рубриками, причем специалисты-люди определяли критерии полного ответа до того, как оценивалась какая-либо модель ИИ.

Результаты оценки моделей

Meta оценила 14 различных моделей ИИ с помощью бенчмарка GAMUT. Модель с наивысшим результатом — Gemini 3.1 Pro — набрала 58.7%, что подчеркивает сложность бенчмарка и разрыв между текущими возможностями моделей и полной фактической полнотой.

По словам исследователей, GAMUT продемонстрировал сильную дискриминативную способность среди протестированных моделей, то есть мог эффективно отличать более сильные модели от более слабых, а не выдавать сгруппированные или слабо различимые результаты.

Meta сделала ресурсы бенчмарка публично доступными через Hugging Face, что позволяет другим исследователям и разработчикам оценивать собственные модели по тем же рубрикам.

Значение для оценки мультимодального ИИ

Мультимодальная структура GAMUT добавляет к оценке критически важное измерение. Поскольку вопросы бенчмарка привязаны к изображениям с носимых устройств, участвующие модели должны интерпретировать визуальные данные и формировать исчерпывающие текстовые ответы, проверяя как визуальное понимание, так и способность выдавать фактически полные ответы — возможности, которые становятся все более актуальными по мере интеграции ИИ-ассистентов в такие устройства, как умные очки и другие носимые платформы. Сама Meta продвигает умные очки Ray-Ban Meta, что делает фактическую полноту при визуальном ответе на вопросы практической задачей, а не исключительно академической метрикой.