Google DeepMind przedstawia model tłumaczenia języka migowego SL2T
Najważniejsze informacje
- •Model SL2T od Google DeepMind to pierwsza technologia tłumaczenia języka migowego, która przeszła z prototypów badawczych do produktów konsumenckich, uruchamiana początkowo na urządzeniach Pixel 11.
- •Model został wytrenowany na ponad 100 000 godzin danych w ponad 50 językach migowych i osiągnął rekordowy wynik 70 BLEURT w benchmarku FLEURS-ASL.
- •SL2T przetwarza język migowy jako współrzędne punktów charakterystycznych pozy zamiast surowego obrazu z kamery, natychmiast usuwając oryginalne wideo w celu ochrony prywatności użytkowników.
- •Technologia obsługuje początkowo tłumaczenie z amerykańskiego języka migowego na angielski w Gboard i Live Transcribe, a zaplanowano dodanie kolejnych języków i urządzeń.
- •Google DeepMind powołał Komitet Doradczy ds. Sztucznej Inteligencji i Języka Migowego (AISLAC) i zaangażował członków społeczności Głuchych na każdym etapie rozwoju, aby zapewnić odpowiedzialne wdrożenie.

Google DeepMind przedstawia model tłumaczenia języka migowego SL2T
Zespół ds. języka migowego Google DeepMind
Google DeepMind przedstawia sign-language-to-text (SL2T) — nowy model zaprojektowany do obsługi funkcji języka migowego dla użytkowników niesłyszących i słabosłyszących.
W ostatnich dekadach systemy sztucznej inteligencji poczyniły znaczne postępy w przetwarzaniu języków mówionych, umożliwiając automatyczne tłumaczenie, dyktowanie i interfejsy konwersacyjne dla użytkowników słyszących. Postęp ten nie objął jednak ponad 200 języków migowych na świecie ani szacunkowo 70 milionów osób niesłyszących i słabosłyszących, które się nimi posługują.
Google DeepMind oświadczył, że wprowadza teraz wielojęzyczny model tłumaczenia sign-language-to-text na niespotykaną skalę, który określa jako przełom w zakresie jakości i uniwersalności. Po raz pierwszy technologia ta wychodzi z laboratorium do produktów konsumenckich. Choć badacze akademiccy i firmy technologiczne badają rozpoznawanie języka migowego od lat, tłumaczenie w czasie rzeczywistym z języka migowego na tekst w dużej mierze pozostawało ograniczone do prototypów badawczych, co czyni wdrożenie SL2T w aplikacjach konsumenckich istotnym kamieniem milowym w dziedzinie dostępności opartej na sztucznej inteligencji. SL2T napędza dyktowanie z języka migowego na tekst w Gboard i Live Transcribe na Pixel 11, począwszy od amerykańskiego języka migowego (ASL) na angielski. Wkrótce spodziewane są kolejne urządzenia, a następne języki zostaną dodane w przyszłości.
Podobnie jak dyktowanie głosowe dla użytkowników słyszących, funkcja ta pozwala użytkownikom niesłyszącym komunikować się z telefonem w języku migowym wszędzie tam, gdzie normalnie wpisaliby tekst. Użytkownicy mogą posługiwać się językiem migowym do wyszukiwania w internecie, redagowania wiadomości lub dokumentów oraz proszenia Gemini o odpowiedzi na zapytania lub wykonywanie zadań. W Live Transcribe użytkownicy mogą odpowiadać w języku migowym podczas rozmów, zamiast wpisywać tekst z obu stron. Według testerów posługiwanie się ASL jest szybsze, bardziej naturalne i przyjemniejsze niż wpisywanie tekstu w języku angielskim.
Dlaczego języki migowe są ważne
Języki migowe są głównymi językami społeczności Głuchych na całym świecie i stanowią centralny element tożsamości kulturowej osób głuchych. Osoby głuche różnią się znacznie pod względem biegłości w posługiwaniu się językiem migowym, mówieniu, czytaniu i pisaniu, dlatego wsparcie we wszystkich modalnościach jest istotne. Przetwarzanie języka migowego może przynieść osobom głuchym takie same korzyści, jakie przetwarzanie języka mówionego przynosi użytkownikom słyszącym, jednocześnie tworząc nowe możliwości komunikacji między społecznościami osób głuchych i słyszących.
Mimo tego potencjału postęp w dziedzinie sztucznej inteligencji dla języka migowego był powolny. Google DeepMind oświadczył, że odzwierciedla to zarówno techniczną trudność tej pracy, jak i powszechne błędne przekonania dotyczące funkcjonowania języków migowych.
W porównaniu z transkrypcją języka mówionego tłumaczenie języka migowego stawia dwa główne wyzwania. Po pierwsze, transkrypcja mowy polega na sekwencyjnym mapowaniu dźwięku na tekst w tym samym języku, podczas gdy języki migowe są niezależnymi językami naturalnymi z własnymi gramatykami i słownikami. Oznacza to, że wymagają one pełnego tłumaczenia maszynowego, a nie prostego przekładu znak-na-słowo. Po drugie, model musi nauczyć się „widzieć" i interpretować ruch fizyczny. Języki migowe wykorzystują jednoczesne ruchy rąk, ramion, tułowia, głowy i twarzy, co sprawia, że dokładne śledzenie przy wysokich częstotliwościach klatek jest wymagającym zadaniem z zakresu wizji komputerowej.
Google DeepMind oświadczył, że dlatego właśnie wczesne technologie języka migowego, takie jak rękawice do języka migowego, były fundamentalnie ograniczone. Języki migowe to nie po prostu „angielski na dłoniach". Wymagają one szczegółowej percepcji wzrokowej precyzyjnych ruchów całego ciała oraz pełnego tłumaczenia językowego. SL2T został zaprojektowany tak, aby sprostać obu tym zadaniom.
SL2T traktuje wejście w języku migowym jako punkty na ciele osoby migającej i przekłada te dane na strumieniowe wyjście tekstowe. Przykład z benchmarku FLEURS-ASL.
Jak działa SL2T
Google DeepMind oświadczył, że zbudował SL2T, łącząc podejście zorientowane na użytkownika i uwzględniające aspekty kulturowe z trenowaniem na dużą skalę danych. Model został wytrenowany na ponad 100 000 godzin danych w ponad 50 językach migowych, przy czym około jedna czwarta danych dotyczyła ASL. Ta skala jest znacząca w dziedzinie, w której niedobór danych był stałym wąskim gardłem, ponieważ zbieranie nagrań wideo w języku migowym jest znacznie bardziej zasobochłonne niż gromadzenie mowy lub tekstu. Wspólne trenowanie na zróżnicowanych językach, dialektach i poziomach biegłości pomogło modelowi nauczyć się wspólnych struktur i prześcignąć modele jednolęzyczne w eksperymentach firmy.
Aby chronić prywatność użytkowników, SL2T przetwarza język migowy jako sekwencję lokalizacji punktów charakterystycznych pozy, a nie jako surowy obraz z kamery. Model na urządzeniu, MediaPipe Holistic, śledzi lokalizację punktów na ciele osoby migającej, a do serwera wysyłane są wyłącznie te współrzędne geometryczne w celu tłumaczenia, co pozwala na natychmiastowe usunięcie oryginalnego wideo. Ten projekt odzwierciedla szerszą zmianę w branży w kierunku architektur sztucznej inteligencji chroniących prywatność, w których wrażliwe dane wejściowe, takie jak obraz z kamery, są przetwarzane lokalnie, gdy tylko jest to możliwe, w celu ograniczenia ekspozycji danych.
Model przekłada sekwencję współrzędnych bezpośrednio na tekst, omijając pośrednie adnotacje zwane glosami, które są powszechnie stosowane we wcześniejszych badaniach nad tłumaczeniem języka migowego. Google DeepMind oświadczył, że glosy nie oddają nieliniowych aspektów języków migowych, takich jak znaczniki niemanualne i konstrukcje przestrzenne. Tłumaczenie bezpośrednio z punktów charakterystycznych usuwa sztuczne ograniczenia słownictwa i pozwala jakości tłumaczenia rosnąć wraz z ilością danych.
Według kluczowych benchmarków, takich jak FLEURS-ASL (sd-test), mierzących jakość tłumaczenia z ASL na angielski, SL2T jest najbardziej zaawansowanym modelem tłumaczenia języka migowego do tej pory. Google DeepMind oświadczył, że model osiągnął wynik zero-shot 70 BLEURT, wyższy niż jakikolwiek wcześniej zgłoszony wynik.
Firma oświadczyła również, że skupiła się na praktycznych kwestiach wdrożeniowych wykraczających poza wyniki benchmarków, w tym na minimalizowaniu opóźnień w przesyłaniu strumieniowym, zapobieganiu halucynacjom przy wejściach niezawierających języka migowego, zapewnieniu sprawiedliwości dla 10% osób migających lewą ręką oraz poprawie wydajności dla migania jedną ręką, co ma miejsce, gdy drugą ręką trzyma się smartfon.
Przykłady z benchmarku FLEURS-ASL pokazują SL2T tłumaczącego złożone wyrażenia ASL na płynny angielski. Google DeepMind oświadczył, że pewne błędy nadal występują, w tym rzadkie znaki, szybkie literowanie palcami ("prey" → "grey"), konstrukcje bierne, wyrażenia klasyfikatorowe (pominięcie "claws") oraz czasy bez kontekstu ("kicked off" → "start").
Budowanie ze społecznością
Google DeepMind oświadczył, że wierzy w budowanie ze społecznością Głuchych, a nie tylko dla niej. Perspektywy osób głuchych wpłynęły na każdy etap projektu — od koncepcji autorstwa Sama Sepaha, głuchego pracownika Google, przez zbieranie danych z partnerami ze społeczności Głuchych, ocenę w badaniach z udziałem głuchych użytkowników, po ocenę wpływu technologii z ekspertami ze społeczności Głuchych.
Aby wesprzeć odpowiednie wdrożenie w rzeczywistym świecie, firma powołała Komitet Doradczy ds. Sztucznej Inteligencji i Języka Migowego (AISLAC), który zrzesza globalne organizacje osób głuchych i ekspertów dziedzinowych. Dzięki temu modelowi zarządzania partycypacyjnego społeczności najbardziej dotknięte technologią mogą bezpośrednio kształtować priorytety rozwoju.
Google DeepMind współtworzył również wspólny raport o wpływie z okazji udostępnienia SL2T 1.0 w Gboard i Live Transcribe, opisujący możliwości i obecne ograniczenia technologii. Firma oświadczyła, że planuje kontynuować to podejście przy wszystkich głównych udostępnieniach związanych z językiem migowym.
Perspektywy na przyszłość
SL2T opiera się na dekadach badań podstawowych prowadzonych zarówno w środowisku akademickim, jak i w branży, ale Google DeepMind oświadczył, że wprowadzenie wprowadzania w ASL na telefony użytkowników to dopiero początek. Firma oświadczyła, że jej misją jest organizacja światowych informacji i uczynienie ich powszechnie dostępnymi i użytecznymi, a powszechna dostępność wymaga równoważności z językami mówionymi i pisanymi.
Zespół oświadczył, że pracuje nad rozszerzeniem technologii na dodatkowe języki migowe, generowanie języka migowego oraz zaawansowane możliwości sztucznej inteligencji. Google DeepMind oświadczył, że dąży do odpowiedzialnego dzielenia się postępami, aby dostęp za pośrednictwem języków migowych stał się standardem w całym krajobrazie cyfrowym.
Pierwsze udostępnienie na urządzeniach Pixel jest zgodne z utartym schematem Google, polegającym na prezentowaniu funkcji opartych na sztucznej inteligencji na swoim flagowym sprzęcie przed rozszerzeniem ich na szerszy ekosystem Android. Użytkownicy mogą wypróbować SL2T w Gboard i Live Transcribe najpierw na Pixel 11, a wkrótce pojawią się kolejne urządzenia — wszystko bez dodatkowych kosztów.
Podziękowania
Praca została wykonana wspólnie przez zespoły Google DeepMind i Android. Zespół podstawowy, który opracował model SL2T, obejmuje: Garrett Tanzer, Benoit Brard, Elizabeth Clark, Tim Dozat, Sebastian Ebert, Dan Garrette, Manfred Georg, Vicky Holgate, Shankar Kumar, Mohammad Saboorian, Miloš Stanojević, Megh Umekar, John Wieting, Andy Zhang i Chris Dyer.
Zespół Android, który zintegrował model z Gboard i Live Transcribe, obejmuje: Ausmus Chang, Sai Aditya Chitturu, Dayle Chiu, Anna Chou, Ajay Dudani, Angana Ghosh, Alex Huang, Joanne Kim, Ed Lee, Thomas Lin, James Su, Yanchao Su i Sharlene Yuan.
Dodatkowe wsparcie zapewniли: Anelia Angelova, Abhishek Bapna, Sara Basson, Glenn Cameron, Scott Crowell, Trevor Cohn, Noah Fiedel, Zoubin Ghahramani, Raia Hadsell, Tom Hudson, Alexander Hauerslev Jensen, Kazuya Kawakami, Peike Li, Liam McCafferty, Caroline Pantofaru, Abhinav Parashar, Christopher Patnoe, Laura Rimell, Sam Sepah, Thad Starner, Dave Uthus i Biao Zhang.
Zespół podziękował również osobom, które wzięły udział we wczesnym testowaniu modeli.