НовостиМакроGoogle DeepMind представляет модель SL2T для перевода жестового языка

Google DeepMind представляет модель SL2T для перевода жестового языка

Автор: Google DeepMind Blog·

Ключевые выводы

  • SL2T от Google DeepMind — первая технология перевода жестового языка, которая перешла из исследовательских прототипов в потребительские продукты, начав запуск на устройствах Pixel 11.
  • Модель обучена на более чем 100,000 часов данных по более чем 50 жестовым языкам и достигла рекордного результата 70 BLEURT на бенчмарке FLEURS-ASL.
  • SL2T обрабатывает жестовый язык как координаты опорных точек позы, а не как сырые видеопотоки, сразу удаляя исходное видео для защиты конфиденциальности.
  • Сначала технология поддерживает перевод с American Sign Language на английский в Gboard и Live Transcribe; в будущем планируются дополнительные языки и устройства.
  • Google DeepMind создала AI Sign Language Advisory Committee и привлекала членов глухого сообщества на всех этапах разработки для ответственного внедрения.
Google DeepMind представляет модель SL2T для перевода жестового языка

Google DeepMind представляет модель SL2T для перевода жестового языка

Команда Google DeepMind по жестовому языку

Google DeepMind представляет sign-language-to-text (SL2T) — новую модель, предназначенную для поддержки функций жестового языка для глухих и слабослышащих пользователей.

За последние десятилетия системы ИИ добились значительного прогресса в обработке устных языков, обеспечив автоматический перевод, диктовку и разговорные интерфейсы для слышащих пользователей. Однако этот прогресс не распространился на более чем 200 жестовых языков мира и на примерно 70 million глухих и слабослышащих людей, которые ими пользуются.

Google DeepMind заявила, что теперь запускает многоязычную в высокой степени sign-language-to-text модель, которую описывает как прорыв по качеству и универсальности. Впервые эта технология переходит из лаборатории в потребительские продукты. Хотя академические исследователи и технологические компании годами изучали распознавание жестового языка, перевод жестов в текст в реальном времени в основном оставался в рамках исследовательских прототипов, что делает внедрение SL2T в потребительские приложения заметной вехой в области доступного ИИ. SL2T обеспечивает жестовый набор текста в Gboard и Live Transcribe на Pixel 11, начиная с перевода с American Sign Language (ASL) на английский. Скоро появятся дополнительные устройства, а затем и дополнительные языки.

Подобно тому как слышащие пользователи используют диктовку, чтобы говорить вместо набора текста, эта функция позволяет глухим пользователям вводить текст жестами на телефоне в любых случаях, когда они обычно печатают. Можно жестами выполнять поиск в интернете, составлять сообщения или документы и просить Gemini решать запросы или выполнять задачи. В Live Transcribe можно отвечать в разговоре жестами вместо того, чтобы печатать туда и обратно. По словам наших тестировщиков, ввод жестами на ASL быстрее, естественнее и приятнее, чем набор текста на английском.

Жестовый ввод текста, работающий на SL2T, позволяет пользователям вводить текст жестами на телефоне в любых случаях, когда они обычно печатают.

Почему жестовые языки важны

Жестовые языки — это основные языки глухих сообществ по всему миру и краеугольный камень культурной идентичности глухих. Среди глухих людей существует большое разнообразие по уровню владения жестами, устной речью, чтением и письмом, поэтому важно поддерживать доступ во всех модальностях. Глухие люди могут получать выгоду от обработки жестового языка так же, как слышащие люди получают выгоду от обработки устного языка, а кроме того, технология открывает новые возможности для преодоления коммуникационного разрыва между глухими и слышащими сообществами.

Несмотря на этот потенциал положительного социального воздействия, прогресс в области ИИ для жестового языка был медленным — как из-за сложности создания таких систем, так и из-за распространённых заблуждений о том, как устроены сами языки.

По сравнению с транскрипцией устной речи перевод жестового языка сталкивается с двумя ключевыми трудностями. Во-первых, транскрибирование речи — это последовательное отображение звука в текст в рамках одного и того же языка, тогда как жестовые языки являются самостоятельными естественными языками со своей собственной грамматикой и лексикой. Следовательно, им нужен настоящий машинный перевод, а не последовательный процесс преобразования жестов в слова. Во-вторых, модель должна научиться «видеть» и понимать физическое движение. Жестовые языки передают смысл через одновременные движения рук, плеч, корпуса, головы и лица. Точное отслеживание этого на высоких частотах кадров — сложная и вычислительно затратная задача компьютерного зрения.

С учётом этого легко понять, почему некоторые ранние попытки создания технологий для жестового языка, например перчатки для жестового языка, были принципиально ограничены: жестовые языки — это не просто «английский на руках». Им требуется сложное визуальное восприятие тонких движений всего тела и полноценный языковой перевод. SL2T спроектирована так, чтобы обеспечивать и то, и другое.

SL2T рассматривает входные данные жестового языка как точки на теле человека, выполняющего жесты, и переводит их в потоковый текстовый вывод. Пример из бенчмарка FLEURS-ASL.

Как работает SL2T

Мы создали SL2T, сочетая ориентированный на пользователя, учитывающий культурный контекст подход с масштабированием данных. Модель обучена на более чем 100,000 часов данных по более чем 50 жестовым языкам — примерно четверть данных приходится на ASL. Совместное обучение на разнообразных языках, диалектах и уровнях владения заставляет модель изучать общие базовые структуры, что в наших экспериментах дало лучший результат, чем у одноязычных моделей.

Чтобы защитить конфиденциальность пользователей, SL2T рассматривает жестовый язык как последовательность координат опорных точек позы, а не как сырой поток с камеры. Встроенная на устройстве модель ( MediaPipe Holistic ) отслеживает положение точек на человеке, выполняющем жесты, и только эти геометрические координаты отправляются на сервер для перевода, что позволяет сразу удалить исходное видео.

SL2T переводит эту последовательность координат напрямую в текст, минуя промежуточные разметки, известные как «glosses», которые широко используются в предыдущих работах по переводу жестового языка. Glosses не отражают богатые нелинейные аспекты жестовых языков, такие как немануальные маркеры и пространственные конструкции. Прямой перевод с опорных точек убирает искусственные ограничения словаря и позволяет качеству перевода расти непосредственно вместе с объёмом данных.

SL2T — самая способная на сегодняшний день модель перевода жестового языка, согласно ключевым бенчмаркам, таким как FLEURS-ASL (sd-test), который оценивает качество перевода с ASL на английский. SL2T достигла выдающегося zero-shot результата 70 BLEURT, что значительно выше любого ранее опубликованного результата. Но одной лишь оптимизации академических бенчмарков недостаточно для практического применения, поэтому мы уделили большое внимание таким вопросам, как минимизация задержки потоковой передачи, предотвращение галлюцинаций на не-жестовых входах, обеспечение справедливости для 10% жестовых пользователей, которые являются левшами, и улучшение качества для одноручного жестового ввода, который используется, когда в другой руке находится смартфон.

Примеры из бенчмарка FLEURS-ASL. SL2T точно переводит сложный ASL в беглый английский. Отдельные ошибки по-прежнему встречаются в редких жестах, быстром по буквам пальцевом написании ("prey" → "grey"), пассивных конструкциях, классификаторных изображениях (пропуск "claws") и выражении времени без контекста ("kicked off" → "start").

Создание вместе с сообществом

Мы считаем, что нужно создавать продукты вместе с глухим сообществом, а не только для него. Взгляды глухих людей влияли на каждый этап проекта — от концепции, предложенной Sam Sepah, глухим сотрудником Google, до сбора данных с глухими партнёрами, оценки в исследованиях с участием глухих пользователей и анализа воздействия технологии с участием экспертов из глухого сообщества.

Чтобы обеспечить ответственное внедрение в реальном мире, мы создали AI Sign Language Advisory Committee (AISLAC), объединив множество глобальных глухих организаций и профильных экспертов. Благодаря этой модели совместного управления сообщества, на которые технология влияет сильнее всего, напрямую определяют приоритеты развития. Мы совместно подготовили отчёт о влиянии для выпуска SL2T 1.0 в Gboard и Live Transcribe, прозрачно описав возможности технологии и её текущие ограничения — такой совместный подход мы планируем сохранять для всех крупных выпусков, связанных с жестовым языком.

Взгляд в будущее

SL2T опирается на десятилетия фундаментальных исследований в академической среде и индустрии, но перенос ввода ASL на телефоны пользователей — это только начало. Миссия Google — упорядочить мировую информацию и сделать её универсально доступной и полезной. Достижение универсальной доступности означает полное равенство с устными и письменными языками. Наша команда работает над расширением технологии на дополнительные жестовые языки, генерацию жестового языка и передовые возможности ИИ. Мы намерены ответственно делиться нашим прогрессом, чтобы доступ через жестовые языки стал стандартом в цифровой среде.

Попробовать SL2T в Gboard и Live Transcribe можно сначала на Pixel 11, а вскоре и на других устройствах — без дополнительной платы.

Благодарности

Эта работа была выполнена совместно командами Google DeepMind и Android. В основную команду, разработавшую модель SL2T, входят Garrett Tanzer, Benoit Brard, Elizabeth Clark, Tim Dozat, Sebastian Ebert, Dan Garrette, Manfred Georg, Vicky Holgate, Shankar Kumar, Mohammad Saboorian, Miloš Stanojević, Megh Umekar, John Wieting, Andy Zhang и Chris Dyer.

Команда Android, которая интегрировала модель в Gboard и Live Transcribe, включает Ausmus Chang, Sai Aditya Chitturu, Dayle Chiu, Anna Chou, Ajay Dudani, Angana Ghosh, Alex Huang, Joanne Kim, Ed Lee, Thomas Lin, James Su, Yanchao Su и Sharlene Yuan.

Мы благодарны за дополнительную поддержку Anelia Angelova, Abhishek Bapna, Sara Basson, Glenn Cameron, Scott Crowell, Trevor Cohn, Noah Fiedel, Zoubin Ghahramani, Raia Hadsell, Tom Hudson, Alexander Hauerslev Jensen, Kazuya Kawakami, Peike Li, Liam McCafferty, Caroline Pantofaru, Abhinav Parashar, Christopher Patnoe, Laura Rimell, Sam Sepah, Thad Starner, Dave Uthus и Biao Zhang.

Отдельная благодарность также тем, кто участвовал в раннем тестировании наших моделей.