ActualitésActionsMeta publie le benchmark GAMUT pour évaluer l'exhaustivité factuelle des IA multimodales

Meta publie le benchmark GAMUT pour évaluer l'exhaustivité factuelle des IA multimodales

Auteur: CryptoBriefing·

Points clés

  • GAMUT est un nouveau benchmark de Meta AI qui mesure spécifiquement l'exhaustivité factuelle — si les réponses de l'IA incluent toutes les informations pertinentes — plutôt que de simplement détecter les affirmations fausses ou hallucinées.
  • Le benchmark contient 1 813 questions fondées sur des images issues de dispositifs portables dans dix domaines, chacune associée à des grilles d'évaluation expertes structurées en listes de vérification binaires exploitables par machine.
  • Meta a évalué 14 modèles d'IA avec GAMUT, le meilleur performeur Gemini 3.1 Pro n'atteignant que 58,7 %, ce qui démontre la difficulté du benchmark et les limites actuelles des modèles en matière d'exhaustivité factuelle.
  • Le benchmark a montré une forte capacité discriminante, différenciant efficacement les modèles les plus performants des moins performants.
  • Meta a rendu les ressources de GAMUT publiquement disponibles sur Hugging Face pour permettre à d'autres chercheurs et développeurs d'évaluer leurs propres modèles.
Meta publie le benchmark GAMUT pour évaluer l'exhaustivité factuelle des IA multimodales

Les chercheurs de Meta AI ont présenté GAMUT, un nouveau benchmark destiné à évaluer une dimension des performances de l'IA que la plupart des évaluations existantes ont tendance à négliger : l'exhaustivité factuelle. Tandis que les benchmarks de factivité largement utilisés tels que TruthfulQA, FEVER et HaluEval se concentrent sur la détection d'affirmations fausses ou hallucinées, ils ne mesurent généralement pas si la réponse d'un modèle omet des informations pertinentes. GAMUT comble cette lacune en testant si un système d'IA inclut tous les faits pertinents qu'une réponse exhaustive devrait contenir.

Le benchmark, dont le nom complet est Grounded Assessment of Multimodal Factuality, a été présenté dans un article publié sur arXiv le 21 juillet 2026. Il emploie un système structuré basé sur des grilles d'évaluation qui transforme la question de savoir si une IA a couvert toutes les informations nécessaires en listes de vérification binaires exploitables par machine.

Fonctionnement de GAMUT

GAMUT aborde le problème de l'omission d'informations grâce à un cadre de méta-grille d'évaluation à deux niveaux. Le système organise hiérarchiquement le contenu requis — au lieu de simplement lister les faits qu'une réponse devrait inclure, il les structure par importance et par catégorie. Ces exigences sont ensuite converties en questions à réponse par oui ou non que les modèles de langage peuvent évaluer de manière constante et fiable.

Le benchmark comprend 1 813 questions fondées sur des images issues de dispositifs portables réels couvrant dix domaines distincts. Chaque question est associée à des grilles d'évaluation vérifiées par des experts, les spécialistes humains ayant défini les critères d'une réponse complète avant l'évaluation de tout modèle d'IA.

Résultats de performance des modèles

Meta a évalué 14 modèles d'IA différents sur le benchmark GAMUT. Le modèle ayant obtenu le score le plus élevé est Gemini 3.1 Pro, qui a atteint 58,7 % — un résultat qui souligne la difficulté du benchmark et l'écart entre les capacités actuelles des modèles et une exhaustivité factuelle totale.

Selon les chercheurs, GAMUT a démontré une forte capacité discriminante parmi les modèles testés, ce qui signifie qu'il pouvait efficacement distinguer les meilleurs performeurs des moins bons, plutôt que de produire des scores regroupés ou non différenciés.

Meta a rendu les ressources du benchmark publiquement disponibles sur Hugging Face, permettant à d'autres chercheurs et développeurs d'évaluer leurs propres modèles selon les mêmes grilles d'évaluation.

Importance pour l'évaluation de l'IA multimodale

La conception multimodale de GAMUT ajoute une dimension critique à ses évaluations. Étant donné que les questions du benchmark sont ancrées dans des images issues de dispositifs portables, les modèles participants doivent interpréter des entrées visuelles et générer des réponses textuelles exhaustives, testant à la fois la compréhension visuelle et la capacité à produire des réponses factuellement complètes — des compétences qui sont de plus en plus pertinentes à mesure que les assistants IA sont intégrés dans des appareils tels que les lunettes connectées et autres plateformes portables. Meta commercialise elle-même les lunettes connectées Ray-Ban Meta, ce qui fait de l'exhaustivité factuelle dans les systèmes de réponse aux questions visuelles un enjeu pratique plutôt qu'une simple mesure académique.