Google DeepMind推出SL2T手语翻译模型
要点速览
- •Google DeepMind 的 SL2T 模型是首个从研究原型进入消费级产品的手语翻译技术,率先在 Pixel 11 设备上推出。
- •该模型在超过100,000小时、涵盖50多种手语的数据上训练,并在 FLEURS-ASL 基准上取得了创纪录的70 BLEURT分数。
- •SL2T 处理的是姿态关键点坐标,而不是原始摄像头画面,并会立即丢弃原始视频以保护用户隐私。
- •该技术最初支持在 Gboard 和 Live Transcribe 中将美国手语翻译为英语,后续还将支持更多语言和设备。
- •Google DeepMind 成立了 AI Sign Language Advisory Committee,并在整个开发过程中纳入聋人社区成员,以确保负责任的部署。

Google DeepMind推出SL2T手语翻译模型
Google DeepMind 手语团队
Google DeepMind 正在推出 sign-language-to-text(SL2T),这是一款旨在为聋人和听障用户提供手语功能的新模型。
在过去几十年中,AI系统在处理口语方面取得了重大进展,为听力正常用户带来了自动翻译、听写和对话式界面。然而,这些进展并未覆盖全球200多种手语,也未惠及使用这些手语的约7000万聋人和听障人士。
Google DeepMind 表示,现已推出一款大规模多语言的手语转文本翻译模型,并将其描述为在质量和通用性上的突破。该技术首次从实验室走向消费级产品。尽管学术研究人员和科技公司多年来一直在探索手语识别,但实时手语转文本翻译在很大程度上仍局限于研究原型,这使得 SL2T 在消费应用中的部署成为无障碍 AI 领域的一个重要里程碑。SL2T 为 Pixel 11 上的 Gboard 和 Live Transcribe 提供手语转文本听写功能,初始支持美国手语(ASL)到英语的翻译。更多设备即将推出,更多语言也将随后支持。
类似于听力正常用户使用听写来代替打字,这一功能让聋人用户可以在通常需要输入的任何场景下直接对手机做手语。用户可以通过手语搜索网页、起草消息或文档,并让 Gemini 回答查询或执行任务。在 Live Transcribe 中,用户可以在对话中通过手语回应,而不必来回打字。根据测试者反馈,用 ASL 进行手语输入比用英语打字更快、更自然,也更令人愉悦。
SL2T 驱动的手语转文本功能,让用户可以在通常需要输入的任何场景下直接对手机做手语。
为什么手语很重要
手语是全球聋人社群的主要语言,也是聋人文化身份的核心。聋人在手语、口语、阅读和写作方面的熟练程度差异很大,因此支持所有模态都很重要。手语处理可以像口语处理惠及听力正常用户那样惠及聋人,同时也为弥合聋人社群与听力正常社群之间的沟通鸿沟打开新的可能性。
尽管具有积极的社会影响潜力,手语 AI 的进展一直较为缓慢——这既因为为手语构建 AI 本身充满复杂挑战,也因为社会上广泛存在对手语工作方式的误解。
与口语转写相比,手语翻译面临两个核心挑战。首先,语音转写是在同一语言内将声音顺序映射为文本,而手语是独立的自然语言,拥有各自不同的语法和词汇。因此,手语需要真正的机器翻译,而不是简单的手势到词语转换。其次,模型必须学会“看见”并理解身体运动。手语通过手、手臂、躯干、头部和面部的同步运动传递意义。要以高帧率准确追踪这些动作,是一项计算机视觉上极具难度且计算开销很大的任务。
在这样的背景下,人们很容易理解为什么一些早期手语技术尝试,例如手语手套,存在根本性局限:手语并不只是“手上的英语”。它们需要对精细的全身运动进行复杂的视觉感知,并完成完整的语言翻译。SL2T 的设计正是为了同时实现这两点。
SL2T 将手语输入视为手语者身体上的点,并将其翻译为流式文本输出。示例来自 FLEURS-ASL 基准。
SL2T 如何工作
我们通过结合以用户为中心、兼顾文化背景的方法与大规模数据扩展,构建了 SL2T。该模型在超过50种手语、总计超过100,000小时的数据上训练,其中约四分之一为 ASL 数据。联合训练多种语言、方言和熟练程度的数据,会促使模型学习共享的底层结构,在我们的实验中,这一方法优于单语言模型。
为保护用户隐私,SL2T 将手语视为一系列姿态关键点位置,而不是原始摄像头画面。设备端模型( MediaPipe Holistic )会追踪手语者身上的点位,而只有这些几何坐标会被发送到服务器进行翻译,原始视频可随即丢弃。
SL2T 直接将这串坐标序列翻译为文本,绕过了以往手语翻译研究中广泛使用的中间标注“glosses”。Glosses 无法捕捉手语中丰富的非线性特征,例如非手部标记和空间构式。直接从关键点进行翻译消除了人为设定的词汇限制,并使翻译质量能够直接随数据规模提升。
根据 FLEURS-ASL(sd-test)等关键基准,SL2T 是迄今最强大的手语翻译模型,该基准用于评估 ASL 到英语的翻译质量。SL2T 在零样本设置下取得了70 BLEURT 的成绩,显著高于此前报告的任何分数。但仅优化学术基准并不能保证真实场景中的可用性,因此我们还重点解决了诸如降低流式延迟、防止对非手语输入产生幻觉、确保对占手语者10%的左撇子群体公平,以及提升单手手语表现等实际问题;后者常用于另一只手拿着智能手机时的场景。
来自 FLEURS-ASL 基准的示例表明,SL2T 能够将复杂的 ASL 准确翻译为流畅的英语。仍然存在一些偶发错误,主要包括罕见手势、快速拼字母("prey" → "grey")、被动结构、分类词描绘(遗漏 "claws"),以及缺乏上下文时的时态判断("kicked off" → "start")。
与社区共同构建
我们相信要与聋人社区共同构建,而不只是为他们构建。聋人视角贯穿了项目的每一个阶段——从由聋人 Google 员工 Sam Sepah 提出概念,到与聋人合作伙伴共同进行数据收集、在聋人用户研究中进行评估,以及与聋人专家一起开展技术影响评估。
为指导负责任的现实部署,我们成立了 AI Sign Language Advisory Committee(AISLAC),汇集了多个全球聋人组织和领域专家。通过这种参与式治理模式,受该技术影响最深的社区能够直接影响我们的开发优先事项。我们还为 SL2T 1.0 在 Gboard 和 Live Transcribe 中的发布共同撰写了一份联合影响报告,透明说明了该技术的能力与当前局限——我们计划在所有重大的手语发布中继续采用这一协作方式。
展望未来
SL2T 建立在学术界和工业界数十年的基础研究之上,但将 ASL 输入带到用户手机上只是开始。Google 的使命是组织全球信息,并使其普遍可访问且有用。实现普遍可访问,意味着要达到与口语和书面语言完全同等的水平。我们的团队正在将这项技术扩展到更多手语、手语生成以及前沿 AI 能力。我们期待以负责任的方式分享进展,让通过手语实现的无障碍访问在数字环境中成为标准。
用户可以在 Pixel 11 上率先在 Gboard 和 Live Transcribe 中体验 SL2T,更多设备即将推出,且无需额外费用。
致谢
这项工作由 Google DeepMind 和 Android 团队共同完成。开发 SL2T 模型的核心团队包括:Garrett Tanzer, Benoit Brard, Elizabeth Clark, Tim Dozat, Sebastian Ebert, Dan Garrette, Manfred Georg, Vicky Holgate, Shankar Kumar, Mohammad Saboorian, Miloš Stanojević, Megh Umekar, John Wieting, Andy Zhang 和 Chris Dyer。
将该模型集成到 Gboard 和 Live Transcribe 的 Android 团队包括:Ausmus Chang, Sai Aditya Chitturu, Dayle Chiu, Anna Chou, Ajay Dudani, Angana Ghosh, Alex Huang, Joanne Kim, Ed Lee, Thomas Lin, James Su, Yanchao Su 和 Sharlene Yuan。
我们还感谢 Anelia Angelova, Abhishek Bapna, Sara Basson, Glenn Cameron, Scott Crowell, Trevor Cohn, Noah Fiedel, Zoubin Ghahramani, Raia Hadsell, Tom Hudson, Alexander Hauerslev Jensen, Kazuya Kawakami, Peike Li, Liam McCafferty, Caroline Pantofaru, Abhinav Parashar, Christopher Patnoe, Laura Rimell, Sam Sepah, Thad Starner, Dave Uthus 和 Biao Zhang 提供的额外支持。
此外,也非常感谢参与模型早期阶段测试的各位。