NieuwsAandelenIBM Research brengt BenchDrift uit, een open-sourcetool die meet hoe promptformulering LLM-benchmarkscores doet verschuiven

IBM Research brengt BenchDrift uit, een open-sourcetool die meet hoe promptformulering LLM-benchmarkscores doet verschuiven

Auteur: CryptoBriefing·

Belangrijkste punten

  • BenchDrift meet "bidirectional correctness flips": gevallen waarin het antwoord van een model uitsluitend door herformulering van juist naar onjuist verandert, of andersom.
  • IBM Research testte acht modellen op GSM8K, MMLU en MATH-Hard en vond formuleringgerelateerde drift op alle drie de benchmarks.
  • Zwakkere modellen hadden vaker baat bij geherformuleerde vragen, terwijl sterkere modellen vaker nauwkeurigheid verloren wanneer prompts werden herschreven.
  • De onderzoekers ontdekten dat zelfs antwoorden met een hoge zekerheidsscore kunnen veranderen door kleine verschillen in de lengte of stijl van een vraag.
  • IBM heeft BenchDrft als open source uitgebracht op GitHub, met pipelinecode, notebooks en configuratiebestanden.
IBM Research brengt BenchDrift uit, een open-sourcetool die meet hoe promptformulering LLM-benchmarkscores doet verschuiven

IBM Research heeft een paper gepubliceerd waarin BenchDrift wordt geïntroduceerd, een open-sourcetool die is ontworpen om te kwantificeren hoeveel benchmarkscores van grote taalmodellen verschuiven wanneer testprompts worden geherformuleerd zonder enige verandering in betekenis. Het project legt een concreet getal vast op een probleem dat vertrouwd is voor iedereen die ooit een examen glansrijk heeft afgelegd, om vervolgens te zakken voor een herkansing met iets anders geformuleerde vragen.

Hoe BenchDrift werkt

De onderliggende methode is eenvoudig: neem een benchmarkvraag, herschrijf deze zodanig dat de betekenis en het juiste antwoord behouden blijven, en controleer of het model nog steeds correct antwoordt. BenchDrift past dit proces systematisch toe langs vier verschillende variatie-assen: taalkundig, referentieel, pragmatisch en structureel.

De tool genereert op grote schaal geherformuleerde varianten en registreert vervolgens wat de onderzoekers "bidirectional correctness flips" noemen — gevallen waarin het antwoord van een model uitsluitend door de formulering van juist naar onjuist omslaat, of van onjuist naar juist.

Het onderzoeksteam, onder leiding van Shailja Thakur, Sungeun An, Chad DeLuca en Hima Patel bij IBM Research, evalueerde acht modellen op drie veelgebruikte benchmarks: GSM8K (wiskunde op basisschoolniveau), MMLU (massaal meertaken-taalbegrip) en MATH-Hard (geavanceerd wiskundig redeneren). Volgens het paper trad overal drift op, wat onderstreept dat een benchmarkscore gevoelig kan zijn voor formulering, zelfs wanneer de onderliggende taak onveranderd blijft.

Sterkere modellen, grotere problemen

Het patroon was niet uniform over de verschillende capaciteitsniveaus. Zwakkere modellen hadden juist de neiging te profiteren van geherformuleerde vragen, waardoor ze juiste antwoorden vonden die ze eerder hadden gemist. Sterkere modellen vertoonden het tegenovergestelde gedrag: ze verloren aanzienlijk meer nauwkeurigheid wanneer vragen werden geherformuleerd, terwijl de onderliggende betekenis identiek bleef.

De onderzoekers constateerden daarnaast dat antwoorden met een hoge zekerheidsscore kunnen verslechteren door kleine veranderingen in de lengte of stijl van een vraag. Dit wijst erop dat, zelfs wanneer een model zeker lijkt te zijn van zijn antwoord, die zekerheid mogelijk is verankerd in specifieke formuleringen in plaats van in daadwerkelijk begrip.

Waarom de kwetsbaarheid van benchmarks ook buiten het lab van belang is

BenchDrift voegt bewijs toe aan een groeiend aantal aanwijzingen dat de huidige evaluatie-infrastructuur voor LLM's fundamentele zwakke plekken heeft. Eerder werk van IBM zelf op dit gebied omvat de projecten ITBench en BenchmarkCards, beide gericht op het verbeteren van transparantie bij AI-beoordeling. BenchDrift breidt die inspanning uit met een kwantitatief raamwerk voor wat de onderzoekers het "wording effect" noemen — de meetbare kloof tussen wat een benchmarkscore beweert en wat deze daadwerkelijk aantoont.

Dat is van belang voor iedereen die benchmarkresultaten gebruikt om modellen te vergelijken, de voortgang in de tijd te volgen of kleine scoreverschillen te interpreteren, omdat gevoeligheid voor formulering die vergelijkingen minder stabiel kan maken dan ze in eerste instantie lijken. De tool is als open source uitgebracht via de GitHub-repository IBM/BenchDrift. De release omvat de volledige pipelinecode, Jupyter-notebooks en configuratiebestanden die nodig zijn om vraagvarianten te genereren, te valideren dat die varianten de betekenis behouden, en correctheidsdrift te detecteren.