IBM przedstawia BenchDrift, narzędzie do ilościowego pomiaru wpływu sformułowania na wyniki benchmarków LLM
Najważniejsze informacje
- •BenchDrift mierzy „bidirectional correctness flips”, czyli zmiany odpowiedzi modelu z poprawnej na niepoprawną lub odwrotnie wyłącznie z powodu przeformułowania.
- •IBM Research przetestowało osiem modeli na GSM8K, MMLU i MATH-Hard i stwierdziło drift związany ze sformułowaniem we wszystkich trzech benchmarkach.
- •Słabsze modele częściej zyskiwały na przeformułowanych pytaniach, podczas gdy mocniejsze częściej traciły dokładność po zmianie brzmienia promptu.
- •Badacze stwierdzili, że nawet odpowiedzi o wysokiej pewności mogą zmieniać się przy niewielkich różnicach długości lub stylu pytania.
- •IBM udostępniło BenchDrift jako open source na GitHubie wraz z kodem pipeline’u, notesami i plikami konfiguracyjnymi.

IBM Research opublikowało pracę przedstawiającą BenchDrift, narzędzie open source zaprojektowane do ilościowego pomiaru tego, jak bardzo wyniki benchmarków dużych modeli językowych zmieniają się, gdy pytania testowe są przeformułowane bez zmiany znaczenia. Projekt nadaje konkretną wartość liczbową problemowi znanemu każdemu, kto zdał egzamin, by potem oblać poprawkę zbudowaną ze zdań zapisanych nieco inaczej.
Jak działa BenchDrift
Podstawowa metoda jest prosta: wziąć pytanie benchmarkowe, przepisać je tak, aby zachować jego znaczenie i poprawną odpowiedź, a następnie sprawdzić, czy model nadal odpowiada poprawnie. BenchDrift stosuje ten proces systematycznie w czterech odrębnych wymiarach zmienności: lingwistycznym, referencyjnym, pragmatycznym i strukturalnym.
Narzędzie generuje przeformułowane warianty na dużą skalę, a następnie śledzi to, co badacze nazywają „bidirectional correctness flips” — przypadki, w których odpowiedź modelu zmienia się z poprawnej na niepoprawną lub z niepoprawnej na poprawną wyłącznie na podstawie sformułowania.
Zespół badawczy prowadzony przez Shailja Thakur, Sungeun An, Chad DeLuca i Himę Patel z IBM Research ocenił osiem modeli na trzech szeroko stosowanych benchmarkach: GSM8K (matematyka na poziomie szkoły podstawowej), MMLU (massive multitask language understanding) oraz MATH-Hard (zaawansowane rozumowanie matematyczne). Według pracy drift pojawił się we wszystkich przypadkach, co podkreśla, że wynik benchmarku może być wrażliwy na sformułowanie nawet wtedy, gdy samo zadanie pozostaje niezmienione.
Mocniejsze modele, większe problemy
Wzorzec nie był jednolity na różnych poziomach możliwości. Słabsze modele miały tendencję do czerpania korzyści z przeformułowanych pytań, poprawiając odpowiedzi, które wcześniej były błędne. Mocniejsze modele wykazywały odwrotny efekt: traciły znacznie więcej dokładności, gdy pytania były przeredagowane, mimo że podstawowe znaczenie pozostawało identyczne.
Badacze stwierdzili również, że odpowiedzi udzielane z dużą pewnością mogą pogarszać się przy niewielkich zmianach długości lub stylu pytania, co oznacza, że nawet gdy model wydaje się pewny swojej odpowiedzi, ta pewność może być zakotwiczona w konkretnym sformułowaniu, a nie w rzeczywistym zrozumieniu.
Dlaczego kruchość benchmarków ma znaczenie poza laboratorium
BenchDrift dołącza do rosnącego zbioru dowodów wskazujących, że obecna infrastruktura oceny LLM ma fundamentalne słabości. Wcześniejsze prace IBM w tym obszarze obejmują projekty ITBench i BenchmarkCards, oba nastawione na zwiększenie przejrzystości w ocenie AI. BenchDrift rozwija te działania, dostarczając ilościowe ramy dla tego, co badacze nazywają „wording effect” — mierzalnej różnicy między tym, co deklaruje wynik benchmarku, a tym, co faktycznie pokazuje.
Ma to znaczenie dla każdego, kto wykorzystuje wyniki benchmarków do porównywania modeli, śledzenia postępów w czasie lub interpretowania niewielkich różnic punktowych, ponieważ wrażliwość na sformułowanie może sprawiać, że takie porównania są mniej stabilne, niż wydają się na pierwszy rzut oka. Narzędzie zostało udostępnione jako open source w repozytorium GitHub IBM/BenchDrift. Wydanie obejmuje pełny kod pipeline’u, notesy Jupyter i pliki konfiguracyjne potrzebne do generowania wariantów pytań, weryfikowania, że zachowują one znaczenie, oraz wykrywania driftu poprawności.