Google DeepMind przeprowadza pilotaż pierwszych na świecie podwójnie zaślepionych ewaluacji modeli AI
Najważniejsze informacje
- •Pilotaż wykorzystuje usługę Confidential Space z Google Cloud, aby podczas testów żadna ze stron nie miała wglądu w wrażliwe dane wejściowe drugiej strony.
- •Według Google takie rozwiązanie pomaga ograniczyć kontaminację benchmarków, w której wcześniejsza ekspozycja na pytania testowe może zawyżać wyniki modeli.
- •Ewaluacja jest realizowana we współpracy z Singapore AI Safety Institute, OpenMined, AVERI i MLCommons.
- •Zdaniem Google metoda jest szczególnie istotna dla ocen o wysokiej stawce w obszarach takich jak cyberbezpieczeństwo i zastosowania rządowe.
- •Firma przedstawia inicjatywę jako krok w kierunku bardziej wiarygodnego i powszechnie uznanego nadzoru nad modelami AI.

Autorzy: William Isaac, Sol Messing i Kristian Lum
Google DeepMind przedstawił pierwszą na świecie podwójnie zaślepioną ewaluację własnościowego modelu AI klasy frontier — podejście, które utrzymuje zewnętrzne ewaluacje w kryptograficznym „boxie”, dzięki czemu nie mogą one zostać później wykorzystane przez modele do optymalizacji wyników przed testami.
Celem inicjatywy jest budowanie zaufania do benchmarków dla własnościowych modeli przy użyciu kryptograficznie bezpiecznych środowisk. Wyobraźmy sobie ucznia, który ma przystąpić do egzaminu o wysokiej stawce: jeśli uczeń przypadkiem podejrzy wcześniej pytania testowe, doskonały wynik jest obciążony tą wiedzą i staje się osiągnięciem pozbawionym znaczenia. Aby naprawdę zmierzyć, ile uczeń wie, aż do momentu przystąpienia do egzaminu nie powinien on mieć żadnego wglądu w pytania testowe.
Dokładnie takie wyzwanie stoi dziś przed branżą przy ewaluacji zaawansowanych modeli AI. Jeśli model widział już pytania testowe — problem znany jako kontaminacja benchmarków — wynikom można zaufać jedynie w pewnym stopniu. Problem ten jest dobrze udokumentowany w literaturze naukowej: badania wykazały, że publiczne zestawy testowe benchmarków przeciekają do ogromnych korpusów sieciowych wykorzystywanych do trenowania dużych modeli, co skłoniło opiekunów zbiorów danych do dodania narzędzi takich jak „canary strings”, pozwalających twórcom modeli wykryć, czy dany benchmark pojawił się w danych treningowych.
Pilotaż jest realizowany we współpracy z Singapore AI Safety Institute, OpenMined, AVERI i MLCommons. Partnerzy wspólnie przetestują model Gemini Flash Lite na poufnych benchmarkach w środowisku chroniącym prywatność, co zwiększy integralność ewaluacji.
Według Google firma ocenia swoje systemy AI szerokim spektrum ewaluacji na wszystkich etapach rozwoju i wdrażania modeli, ale nie opiera się wyłącznie na testach wewnętrznych. Aby wykrywać potencjalne punkty martwe, firma współpracuje z różnorodną grupą partnerów zewnętrznych — w tym wyspecjalizowanymi laboratoriami badawczymi, organizacjami społeczeństwa obywatelskiego oraz krajowymi instytutami bezpieczeństwa AI (AISIs) — wykorzystując ich unikatową wiedzę do poddawania swoich modeli rygorystycznym testom. Same instytuty AISI są stosunkowo nowym tworem instytucjonalnym: pod koniec 2024 roku instytuty bezpieczeństwa AI m.in. ze Stanów Zjednoczonych, Wielkiej Brytanii, Japonii, Singapuru, Korei Południowej i Unii Europejskiej utworzyły międzynarodową sieć w celu koordynacji ewaluacji zaawansowanych systemów AI.
W miarę jak modele AI zyskują nowe możliwości, kluczowe jest zapewnienie, że model nie widział wcześniej pytań testowych ani promptów, ponieważ wcześniejsza ekspozycja może wypaczać wyniki. Decydenci, badacze i przedsiębiorstwa muszą mieć zaufanie, że benchmarki AI dokładnie odzwierciedlają rzeczywiste możliwości i bezpieczeństwo modelu, lecz jeśli modele mogą z wyprzedzeniem „podglądać” pytania ewaluacyjne, wyniki mogą być sztucznie zawyżane, co podważa to zaufanie.
Choć protokoły zero-logging i rygorystyczne zabezpieczenia umowne od dawna zapewniają poufność zewnętrznych promptów testowych, włączenie zabezpieczeń technicznych i kryptograficznych oznacza istotny krok naprzód w zakresie bezpiecznej ewaluacji modeli.
Jak działają podwójnie zaślepione ewaluacje
Historycznie zewnętrzne ewaluacje o wysokiej stawce wymagały kompromisu. Albo ewaluatorzy przekazywali swoje prompty testowe, ryzykując, że dostawca modelu zobaczy pytania testowe z wyprzedzeniem, albo dostawca modelu przekazywał wagi swojego modelu, narażając własną własność intelektualną.
Ewaluacje podwójnie zaślepione usuwają ten kompromis. Dzięki użyciu usługi Confidential Space z portfolio Confidential Computing w Google Cloud obie strony mogą kryptograficznie zweryfikować, że zewnętrzne dane ewaluacyjne oraz model własnościowy pozostają prywatne i należą do odpowiednich właścicieli. Ewaluator nie może zobaczyć wag modelu Gemini, a Google nie może zobaczyć promptów testowych ewaluatora. Poufne przetwarzanie (confidential computing) to technologia już ugruntowana: opiera się na sprzętowych zaufanych środowiskach wykonawczych, które utrzymują dane zaszyfrowane nawet podczas ich przetwarzania — podejście stosowane już w regulowanych sektorach, takich jak ochrona zdrowia czy finanse.
Nowe podejście do budowania zaufania do ewaluacji modeli
Kryptograficzny dowód pomaga zapobiegać kontaminacji benchmarków i chronić wrażliwe dane. W miarę jak modele stają się bardziej zdolne, ma to szczególne znaczenie dla wysoce wrażliwych ewaluacji, takich jak te stosowane w cyberbezpieczeństwie lub przez organy rządowe. Ewaluacje podwójnie zaślepione umożliwiają niezależnym organizacjom rygorystyczne testowanie zaawansowanych modeli bez naruszania suwerenności danych ani bezpieczeństwa.
Google ma nadzieję, że ten pilotaż wyznaczy nowy etap w nadzorze nad modelami i pomoże całej branży budować bezpieczniejsze, bardziej niezawodne i powszechnie zaufane systemy AI. Więcej szczegółów dotyczących metodologii i ustaleń znajduje się w raporcie technicznym.