NoticiasAccionesIBM Research presenta BenchDrift, una herramienta de código abierto para medir cómo el wording altera las puntuaciones de benchmarks de LLM

IBM Research presenta BenchDrift, una herramienta de código abierto para medir cómo el wording altera las puntuaciones de benchmarks de LLM

Autor: CryptoBriefing·

Puntos clave

  • BenchDrift mide los "bidirectional correctness flips", en los que la respuesta de un modelo cambia de correcta a incorrecta o viceversa solo por la reformulación.
  • IBM Research evaluó ocho modelos en GSM8K, MMLU y MATH-Hard y encontró drift relacionado con el wording en los tres benchmarks.
  • Los modelos más débiles tuvieron más probabilidades de beneficiarse de preguntas reformuladas, mientras que los modelos más fuertes perdieron más precisión al reescribir los prompts.
  • Los investigadores encontraron que incluso respuestas con alta confianza pueden cambiar con pequeñas diferencias en la longitud o el estilo de la pregunta.
  • IBM publicó BenchDrift como código abierto en GitHub con el código del pipeline, notebooks y archivos de configuración.
IBM Research presenta BenchDrift, una herramienta de código abierto para medir cómo el wording altera las puntuaciones de benchmarks de LLM

IBM Research ha publicado un artículo que presenta BenchDrift, una herramienta de código abierto diseñada para cuantificar cuánto cambian las puntuaciones de los benchmarks de modelos de lenguaje de gran tamaño cuando los prompts de prueba se reformulan sin modificar su significado. El proyecto pone una cifra concreta a un problema familiar para cualquiera que haya aprobado un examen solo para luego fallar una reevaluación basada en preguntas ligeramente reescritas.

Cómo funciona BenchDrift

El método subyacente es sencillo: tomar una pregunta de benchmark, reescribirla de forma que se preserve su significado y su respuesta correcta, y comprobar si el modelo sigue respondiendo correctamente. BenchDrift aplica este proceso de manera sistemática a través de cuatro ejes distintos de variación: lingüístico, referencial, pragmático y estructural.

La herramienta genera variaciones reformuladas a gran escala y luego rastrea lo que los investigadores llaman "bidirectional correctness flips", casos en los que la respuesta de un modelo cambia de correcta a incorrecta, o de incorrecta a correcta, basándose solo en la redacción.

El equipo de investigación, dirigido por Shailja Thakur, Sungeun An, Chad DeLuca y Hima Patel en IBM Research, evaluó ocho modelos en tres benchmarks ampliamente utilizados: GSM8K (matemáticas de nivel escolar), MMLU (comprensión lingüística multitarea masiva) y MATH-Hard (razonamiento matemático avanzado). Según el artículo, el drift apareció en todos los casos, lo que subraya que una puntuación de benchmark puede ser sensible al wording incluso cuando la tarea subyacente no cambia.

Modelos más fuertes, problemas mayores

El patrón no fue uniforme entre niveles de capacidad. Los modelos más débiles tendieron a beneficiarse de las preguntas reformuladas, al recuperar respuestas correctas que antes habían fallado. Los modelos más fuertes mostraron el comportamiento opuesto: perdieron significativamente más precisión cuando las preguntas se reescribieron, aunque el significado subyacente siguió siendo idéntico.

Los investigadores también encontraron que las respuestas con alta confianza pueden deteriorarse con cambios menores en la longitud o el estilo de la pregunta, lo que indica que incluso cuando un modelo parece seguro de su respuesta, esa seguridad puede estar anclada en una redacción específica y no en una comprensión real.

Por qué la fragilidad de los benchmarks importa más allá del laboratorio

BenchDrift se suma a un cuerpo creciente de evidencia que sugiere que la infraestructura actual de evaluación de LLM tiene debilidades fundamentales. El trabajo previo de IBM en esta área incluye proyectos como ITBench y BenchmarkCards, ambos orientados a mejorar la transparencia en la evaluación de IA. BenchDrift amplía ese esfuerzo al proporcionar un marco cuantitativo para lo que los investigadores llaman el "wording effect", la brecha medible entre lo que una puntuación de benchmark afirma y lo que realmente demuestra.

La herramienta se ha publicado como código abierto a través del repositorio de GitHub IBM/BenchDrift, que incluye el código completo del pipeline, notebooks de Jupyter y archivos de configuración necesarios para generar variaciones de preguntas, validar que esas variaciones preserven el significado y detectar correctness drift.