Google DeepMind introduceert SL2T-model voor gebarentaalvertaling
Belangrijkste punten
- •Het SL2T-model van Google DeepMind is de eerste gebarentaalvertaaltechnologie die de overstap maakt van onderzoeksprototypes naar consumentenproducten, met een eerste lancering op Pixel 11-apparaten.
- •Het model is getraind op meer dan 100.000 uur data over meer dan 50 gebarentalen en behaalde een record score van 70 BLEURT op de FLEURS-ASL-benchmark.
- •SL2T verwerkt gebarentaal als coördinaten van houdingsmarkeringen in plaats van onbewerkte camerafeeds, waarbij de originele video onmiddellijk wordt verwijderd om de privacy van gebruikers te beschermen.
- •De technologie ondersteunt aanvankelijk vertaling van American Sign Language naar Engels in Gboard en Live Transcribe, met aanvullende talen en apparaten gepland voor de toekomst.
- •Google DeepMind richtte de AI Sign Language Advisory Committee op en betrok leden van de dovengemeenschap gedurende de hele ontwikkeling om verantwoorde implementatie te waarborgen.

Google DeepMind introduceert SL2T-model voor gebarentaalvertaling
Google DeepMind Sign Language Team
Google DeepMind introduceert sign-language-to-text (SL2T), een nieuw model dat is ontworpen om gebarentaal functies aan te sturen voor dove en slechthorende gebruikers.
In de afgelopen decennia hebben AI-systemen grote vooruitgang geboekt in het verwerken van gesproken talen, waardoor automatische vertaling, dicteerfuncties en conversationele interfaces voor horende gebruikers mogelijk zijn geworden. Die vooruitgang heeft echter niet geleid tot doorbraak voor de meer dan 200 gebarentalen in de wereld of de naar schatting 70 miljoen dove en slechthorende mensen die deze gebruiken.
Google DeepMind zei dat het nu een grootschalig meertalig gebarentaal-naar-tekst-vertaalmodel lanceert dat het omschrijft als een doorbraak in kwaliteit en algemene toepasbaarheid. Voor het eerst maakt de technologie de overstap van het lab naar consumentenproducten. Hoewel academische onderzoekers en technologiebedrijven al jaren gebarentaalherkenning onderzoeken, is real-time gebarentaal-naar-tekst-vertaling grotendeels beperkt gebleven tot onderzoeksprototypes, waardoor de inzet van SL2T in consumententoepassingen een opmerkelijke mijlpaal is in toegankelijkheids-AI. SL2T drijft gebarentaal-naar-tekst-dictee aan in Gboard en Live Transcribe op Pixel 11, beginnend met American Sign Language (ASL) naar Engels. Meer apparaten worden binnenkort verwacht, en aanvullende talen zullen volgen.
Net als gesproken dictee voor horende gebruikers, stelt de functie dove gebruikers in staat om naar hun telefoon te gebaren waar ze normaal zouden typen. Gebruikers kunnen gebaren om het web te doorzoeken, berichten of documenten op te stellen, en Gemini vragen om vragen te beantwoorden of taken uit te voeren. In Live Transcribe kunnen gebruikers tijdens gesprekken met gebaren reageren in plaats van heen en weer te typen. Volgens testers is gebaren in ASL sneller, natuurlijker en plezieriger dan typen in het Engels.
Waarom gebarentalen ertoe doen
Gebarentalen zijn de primaire talen van dovengemeenschappen over de hele wereld en een centraal onderdeel van de culturele identiteit van doven. Dove mensen verschillen sterk in hun vaardigheid in gebaren, spreken, lezen en schrijven, waardoor ondersteuning in alle modaliteiten belangrijk is. Verwerking van gebarentaal kan dove mensen ten goede komen op dezelfde manier als verwerking van gesproken taal horende gebruikers ten goede komt, terwijl het ook nieuwe mogelijkheden creëert voor communicatie tussen dove en horende gemeenschappen.
Ondanks die potentie is de voortgang in gebarentaal-AI langzaam geweest. Google DeepMind zei dat dit zowel de technische moeilijkheid van het werk weerspiegelt als veelvoorkomende misvattingen over hoe gebarentalen functioneren.
Vergeleken met transcriptie van gesproken taal vormt gebarentaalvertaling twee grote uitdagingen. Ten eerste is spraaktranscriptie een opeenvolgende afbeelding van geluid naar tekst in dezelfde taal, terwijl gebarentalen onafhankelijke natuurlijke talen zijn met eigen grammatica's en woordenschat. Dat betekent dat ze echte machinevertaling vereisen, geen eenvoudige conversie van gebaar naar woord. Ten tweede moet het model leren zien en interpreteren van fysieke beweging. Gebarentalen gebruiken gelijktijdige bewegingen van de handen, armen, romp, het hoofd en het gezicht, wat nauwkeurige tracking met hoge framerates tot een veeleisende computer vision-taak maakt.
Google DeepMind zei dat dit de reden is waarom vroege gebarentaaltechnologieën zoals gebarentaalhandschoenen fundamenteel beperkt waren. Gebarentalen zijn niet eenvoudigweg "Engels op de handen." Ze vereisen gedetailleerde visuele waarneming van fijnmazige bewegingen van het hele lichaam en volledige taalvertaling. SL2T is ontworpen om beide te doen.
SL2T behandelt gebarentaalinvoer als punten op het lichaam van de gebarende en vertaalt die invoer naar streaming tekstuitvoer. Voorbeeld uit de FLEURS-ASL-benchmark.
Hoe SL2T werkt
Google DeepMind zei dat het SL2T bouwde door een gebruikersgerichte, cultureel onderbouwde aanpak te combineren met grootschalige datatraining. Het model is getraind op meer dan 100.000 uur data over meer dan 50 gebarentalen, waarvan ongeveer een kwart van de data in ASL. Deze schaal is opmerkelijk in een veld waar dataschaarste een aanhoudende bottleneck is geweest, aangezien het verzamelen van gebarentaalvideo veel meer middelen vereist dan het verzamelen van spraak of tekst. Gezamenlijke training op diverse talen, dialecten en vaardigheidsniveaus hielp het model gedeelde structuren te leren en presteerde beter dan enkeltalige modellen in de experimenten van het bedrijf.
Om de privacy van gebruikers te beschermen, verwerkt SL2T gebarentaal als een reeks houdingsmarkeringcoördinaten in plaats van een onbewerkte camerafeed. Een on-device model, MediaPipe Holistic, volgt de locatie van punten op de gebarende, en alleen deze geometrische coördinaten worden naar de server gestuurd voor vertaling, waardoor de originele video onmiddellijk kan worden verwijderd. Dit ontwerp weerspiegelt een bredere verschuiving in de industrie naar privacybeschermende AI-architecturen, waarbij gevoelige invoer zoals camerafeeds waar mogelijk lokaal wordt verwerkt om blootstelling van gegevens te beperken.
Het model vertaalt de reeks coördinaten rechtstreeks naar tekst, waarbij tussentijdse annotaties die glosses worden genoemd en veel worden gebruikt in eerder onderzoek naar gebarentaalvertaling, worden overgeslagen. Google DeepMind zei dat glosses de niet-lineaire aspecten van gebarentalen, zoals non-manual markers en ruimtelijke constructies, niet vastleggen. Rechtstreeks vertalen vanaf landmarks verwijdert kunstmatige woordenschatlimieten en stelt de vertaalkwaliteit in staat te schalen met de hoeveelheid data.
Volgens belangrijke benchmarks zoals FLEURS-ASL (sd-test), die de kwaliteit van ASL-naar-Engels-vertaling meet, is SL2T het meest capabele gebarentaalvertaalmodel tot nu toe. Google DeepMind zei dat het model een zero-shot score van 70 BLEURT behaalde, hoger dan enige eerder gerapporteerde score.
Het bedrijf zei dat het zich ook richtte op praktische implementatieproblemen naast benchmarkprestaties, waaronder het minimaliseren van streaming latency, het voorkomen van hallucinaties bij niet-gebarende invoer, het waarborgen van fair play voor de 10% van de gebarende gebruikers die linkshandig is, en het verbeteren van prestaties voor eenhandig gebaren, dat wordt gebruikt bij het vasthouden van een smartphone in de andere hand.
Voorbeelden uit de FLEURS-ASL-benchmark laten zien hoe SL2T complexe ASL vloeiend naar het Engels vertaalt. Google DeepMind zei dat er nog enkele fouten blijven bestaan, waaronder zeldzame gebaren, snel vingerspellen ("prey" → "grey"), passieve constructies, classifier-voorstellingen ("claws" weglaten), en tijd zonder context ("kicked off" → "start").
Bouwen met de gemeenschap
Google DeepMind zei te geloven in bouwen met de dovengemeenschap, niet alleen ervoor. Dove perspectieven beïnvloedden elke fase van het project, van conceptualisatie door Sam Sepah, een dove Googler, tot gegevensverzameling met dove partners, evaluatie in dove gebruikersstudies en impactbeoordeling met dove experts.
Om verantwoorde implementatie in de praktijk te ondersteunen, richtte het bedrijf de AI Sign Language Advisory Committee (AISLAC) op, die wereldwijde dove organisaties en vakexperts samenbrengt. Via dit participatieve bestuursmodel kunnen de gemeenschappen die het meest door de technologie worden beïnvloed, direct de ontwikkelingsprioriteiten beïnvloeden.
Google DeepMind co-auteurs ook een gezamenlijk impactrapport voor de release van SL2T 1.0 in Gboard en Live Transcribe, waarin de mogelijkheden en huidige beperkingen van de technologie transparant worden beschreven. Het bedrijf zei van plan te zijn die aanpak voort te zetten voor alle belangrijke gebarentaalreleases.
Vooruitkijken
SL2T bouwt voort op decennia van fundamenteel onderzoek in academische en industriële kringen, maar Google DeepMind zei dat het brengen van ASL-invoer naar de telefoons van gebruikers pas het begin is. Het bedrijf zei dat haar missie is om 's werelds informatie te organiseren en deze universeel toegankelijk en bruikbaar te maken, en dat universele toegankelijkheid gelijkwaardigheid met gesproken en geschreven talen vereist.
Het team zei te werken aan het uitbreiden van de technologie naar aanvullende gebarentalen, generatie van gebarentaal en geavanceerde AI-mogelijkheden. Google DeepMind zei te streven naar verantwoord delen van voortgang, zodat toegang via gebarentalen de standaard wordt in het digitale landschap.
De uitrol die begint op Pixel volgt het gevestigde patroon van Google om AI-aangedreven functies eerst te introduceren op haar vlaggenschip-hardware voordat deze worden uitgebreid naar het bredere Android-ecosysteem. Gebruikers kunnen SL2T eerst uitproberen in Gboard en Live Transcribe op Pixel 11, met meer apparaten die binnenkort volgen, zonder extra kosten.
Dankbetuigingen
Het werk werd gezamenlijk uitgevoerd door teams van Google DeepMind en Android. Het kernteam dat het SL2T-model ontwikkelde, omvat Garrett Tanzer, Benoit Brard, Elizabeth Clark, Tim Dozat, Sebastian Ebert, Dan Garrette, Manfred Georg, Vicky Holgate, Shankar Kumar, Mohammad Saboorian, Miloš Stanojević, Megh Umekar, John Wieting, Andy Zhang en Chris Dyer.
Het Android-team dat het model integreerde in Gboard en Live Transcribe omvat Ausmus Chang, Sai Aditya Chitturu, Dayle Chiu, Anna Chou, Ajay Dudani, Angana Ghosh, Alex Huang, Joanne Kim, Ed Lee, Thomas Lin, James Su, Yanchao Su en Sharlene Yuan.
Aanvullende ondersteuning kwam van Anelia Angelova, Abhishek Bapna, Sara Basson, Glenn Cameron, Scott Crowell, Trevor Cohn, Noah Fiedel, Zoubin Ghahramani, Raia Hadsell, Tom Hudson, Alexander Hauerslev Jensen, Kazuya Kawakami, Peike Li, Liam McCafferty, Caroline Pantofaru, Abhinav Parashar, Christopher Patnoe, Laura Rimell, Sam Sepah, Thad Starner, Dave Uthus en Biao Zhang.
Het team bedankte ook degenen die deelnamen aan vroegtijdige tests van de modellen.