Meta lanza el benchmark GAMUT para evaluar la completitud factual en IA multimodal
Puntos clave
- •GAMUT es un nuevo benchmark de Meta AI que mide específicamente la completitud factual —si las respuestas de IA incluyen toda la información relevante— en lugar de limitarse a detectar afirmaciones falsas o alucinadas.
- •El benchmark contiene 1,813 preguntas basadas en imágenes de dispositivos vestibles en diez dominios, cada una vinculada a rúbricas verificadas por expertos y estructuradas en listas de verificación binarias calificables por máquina.
- •Meta evaluó 14 modelos de IA con GAMUT, y el puntaje más alto lo obtuvo Gemini 3.1 Pro con solo 58.7%, lo que demuestra la dificultad del benchmark y las limitaciones actuales de los modelos en completitud factual.
- •El benchmark mostró una fuerte capacidad discriminativa, diferenciando eficazmente entre modelos con mejor y peor desempeño.
- •Meta puso los recursos de GAMUT a disposición del público en Hugging Face para que otros investigadores y desarrolladores evalúen sus propios modelos.

Investigadores de Meta AI presentaron GAMUT, un nuevo benchmark orientado a evaluar una dimensión del desempeño de la IA que la mayoría de las evaluaciones existentes suelen pasar por alto: la completitud factual. Mientras que benchmarks de factualidad ampliamente utilizados, como TruthfulQA, FEVER y HaluEval, se centran en detectar afirmaciones falsas o alucinadas, por lo general no miden si la respuesta de un modelo omite información relevante. GAMUT aborda esa brecha al probar si un sistema de IA incluye todos los hechos relevantes que debería contener una respuesta completa.
El benchmark, cuyo nombre completo es Grounded Assessment of Multimodal Factuality, fue detallado en un artículo de arXiv publicado el 21 de julio de 2026. Utiliza un sistema estructurado basado en rúbricas que transforma la pregunta de si una IA cubrió toda la información necesaria en listas de verificación binarias y calificables por máquina.
Cómo funciona GAMUT
GAMUT aborda el problema de la omisión de información mediante un marco de metarrúbrica de dos niveles. El sistema organiza el contenido requerido de forma jerárquica: no se limita a enumerar los hechos que una respuesta debería incluir, sino que los estructura por importancia y categoría. Luego, estos requisitos se convierten en preguntas de sí o no que los modelos de lenguaje pueden calificar de manera consistente y confiable.
El benchmark comprende 1,813 preguntas basadas en imágenes reales de dispositivos vestibles que abarcan diez dominios distintos. Cada pregunta está vinculada a rúbricas verificadas por expertos, con especialistas humanos que definieron los criterios de una respuesta completa antes de evaluar cualquier modelo de IA.
Resultados del desempeño de los modelos
Meta evaluó 14 modelos de IA diferentes con el benchmark GAMUT. El modelo con la puntuación más alta fue Gemini 3.1 Pro, que alcanzó 58.7%, un resultado que subraya la dificultad del benchmark y la brecha entre las capacidades actuales de los modelos y la completitud factual plena.
Según los investigadores, GAMUT demostró una fuerte capacidad discriminativa entre los modelos evaluados, lo que significa que pudo distinguir de manera eficaz a los modelos con mejor desempeño de los más débiles, en lugar de producir puntuaciones agrupadas o poco diferenciadas.
Meta puso los recursos del benchmark a disposición del público a través de Hugging Face, lo que permite que otros investigadores y desarrolladores evalúen sus propios modelos con las mismas rúbricas.
Relevancia para la evaluación de IA multimodal
El diseño multimodal de GAMUT añade una dimensión crítica a sus evaluaciones. Debido a que las preguntas del benchmark están ancladas en imágenes de dispositivos vestibles, los modelos participantes deben interpretar entradas visuales y generar respuestas textuales completas, poniendo a prueba tanto la comprensión visual como la capacidad de producir respuestas factualmente completas, habilidades cada vez más relevantes a medida que los asistentes de IA se integran en dispositivos como lentes inteligentes y otras plataformas vestibles. La propia Meta comercializa los lentes inteligentes Ray-Ban Meta, lo que convierte la completitud factual en preguntas y respuestas visuales en una preocupación práctica, no solo en una métrica académica.