Google DeepMind start 's werelds eerste dubbelblinde evaluaties van AI-modellen
Belangrijkste punten
- •De pilot gebruikt Confidential Space van Google Cloud om te voorkomen dat een van beide partijen tijdens het testen zicht krijgt op de gevoelige invoer van de ander.
- •Volgens Google helpt de opzet benchmarkcontaminatie te verminderen, waarbij eerdere blootstelling aan testvragen modelscores kunstmatig kan doen oplopen.
- •De evaluatie wordt uitgevoerd met het Singapore AI Safety Institute, OpenMined, AVERI en MLCommons.
- •Volgens Google is de methode vooral relevant voor beoordelingen met hoge inzet op gebieden zoals cyberbeveiliging en overheidsgebruik.
- •Het bedrijf presenteert het initiatief als een stap naar betrouwbaarder en breder vertrouwd toezicht op AI-modellen.

Door William Isaac, Sol Messing en Kristian Lum
Google DeepMind heeft 's werelds eerste dubbelblinde evaluatie geïntroduceerd van een propriëtair AI-model van frontierklasse, een aanpak waarbij externe evaluaties beperkt blijven tot een cryptografische "box", waar ze later niet door modellen kunnen worden gebruikt om prestaties te optimaliseren vóór het testen.
Het initiatief is erop gericht vertrouwen op te bouwen in benchmarks voor propriëtaire modellen door gebruik te maken van cryptografisch beveiligde omgevingen. Denk aan een student die een cruciaal examen moet afleggen: als de student per ongeluk van tevoren de examenvragen inziet, wordt een perfecte score beïnvloed door die kennis en verliest de prestatie zijn betekenis. Om werkelijk te meten wat de student weet, mag deze geen zicht hebben op de examenvragen tot het tijd is om het examen af te leggen.
Dat is precies de uitdaging waar de sector voor staat bij het evalueren van geavanceerde AI-modellen. Als een model de testvragen al heeft gezien - een probleem dat bekendstaat als benchmarkcontaminatie - kunnen de resultaten slechts tot op zekere hoogte worden vertrouwd. Deze zorg is ruim gedocumenteerd in de onderzoeksliteratuur, waar studies hebben aangetoond dat openbare benchmarktestsets zijn gelekt naar de webschaalcorpora die worden gebruikt om grote modellen te trainen, wat datasetbeheerders ertoe bracht tools toe te voegen zoals canary strings, waarmee ontwikkelaars kunnen detecteren of een benchmark in de trainingsdata voorkwam.
De pilot wordt uitgevoerd in samenwerking met het Singapore AI Safety Institute, OpenMined, AVERI en MLCommons. Samen zullen de partners een Gemini Flash Lite-model toetsen aan vertrouwelijke benchmarks in een privacybeschermende omgeving, wat de integriteit van de evaluatie vergroot.
Google stelt dat het zijn AI-systemen beoordeelt met een breed spectrum aan evaluaties gedurende de ontwikkeling en inzet van modellen, maar vertrouwt niet uitsluitend op intern onderzoek. Om mogelijke blinde vlekken op te sporen, werkt het bedrijf samen met een diverse groep externe partners - waaronder gespecialiseerde onderzoeksinstellingen, het maatschappelijk middenveld en nationale instituten voor AI-veiligheid en -beveiliging (AISI's) - die met hun unieke expertise de modellen op de proef stellen. Deze AISI's zijn zelf een recente institutionele ontwikkeling: eind 2024 vormden AI-veiligheidsinstituten van overheden, waaronder de Verenigde Staten, het Verenigd Koninkrijk, Japan, Singapore, Zuid-Korea en de Europese Unie, een internationaal netwerk om samen te werken aan de evaluatie van geavanceerde AI-systemen.
Naarmate AI-modellen krachtiger worden, is het cruciaal om te zorgen dat een model de testvragen of prompts niet vooraf heeft gezien, aangezien eerdere blootstelling de resultaten kan vertekenen. Beleidsmakers, onderzoekers en bedrijven moeten erop kunnen vertrouwen dat AI-benchmarks de werkelijke capaciteiten en veiligheid van een model nauwkeurig weerspiegelen, maar als modellen vooraf kunnen "spieken" bij evaluatievragen, kunnen scores kunstmatig worden opgevoerd en wordt dat vertrouwen ondermijnd.
Hoewel zero-logging-protocollen en strikte contractuele waarborgen externe testprompts al lang vertrouwelijk hebben gehouden, vormt de toevoeging van technische en cryptografische waarborgen een belangrijke stap voorwaarts in beveiligde modelevaluatie.
Hoe dubbelblinde evaluaties werken
Historisch gezien vereisten externe evaluaties met hoge inzet een afweging. Of de evaluateurs droegen hun testprompts over, met het risico dat de modelaanbieder de testvragen vooraf zag, of de modelaanbieder droeg zijn modelgewichten over, met het risico op verlies van intellectueel eigendom.
Dubbelblinde evaluaties nemen deze afweging weg. Door Confidential Space binnen het Confidential Computing-aanbod van Google Cloud te gebruiken, kunnen beide partijen cryptografisch verifiëren dat de externe evaluatiedata en het propriëtaire model privé blijven bij hun respectieve eigenaren. De evaluateur kan de modelgewichten van Gemini niet zien, en Google kan de testprompts van de evaluateur niet zien. Confidential computing is zelf een gevestigde technologie: het is gebaseerd op op hardware gebaseerde vertrouwde uitvoeringsomgevingen die gegevens versleuteld houden, zelfs terwijl ze worden verwerkt, een aanpak die al wordt toegepast in gereguleerde sectoren zoals de gezondheidszorg en de financiële dienstverlening.
Een nieuwe aanpak om vertrouwen op te bouwen in modelevaluaties
Dit cryptografische bewijs helpt benchmarkcontaminatie te voorkomen en beschermt gevoelige gegevens. Naarmate modellen krachtiger worden, wordt dit vooral belangrijk voor zeer gevoelige evaluaties, zoals die voor cyberbeveiliging of door overheidsinstanties. Dubbelblinde evaluaties geven onafhankelijke organisaties de mogelijkheid om geavanceerde modellen streng te testen zonder in te leveren op datasoevereiniteit of beveiliging.
Google hoopt dat deze pilot een nieuwe grens stelt voor toezicht op modellen en de bredere sector helpt veiligere, betrouwbaardere en breed vertrouwde AI-systemen te bouwen. Meer details over de methodologie en de bevindingen zijn te vinden in het technische rapport.