Google DeepMind presenta el modelo de traducción de lenguaje de señas SL2T
Puntos clave
- •El modelo SL2T de Google DeepMind es la primera tecnología de traducción de lenguaje de señas que pasa de prototipos de investigación a productos de consumo, con lanzamiento inicial en dispositivos Pixel 11.
- •El modelo fue entrenado con más de 100,000 horas de datos en más de 50 lenguas de señas y logró una puntuación récord de 70 BLEURT en el benchmark FLEURS-ASL.
- •SL2T procesa el lenguaje de señas como coordenadas de puntos de referencia de postura en lugar de video sin procesar, descartando de inmediato el video original para proteger la privacidad del usuario.
- •La tecnología admite inicialmente traducción de ASL a inglés en Gboard y Live Transcribe, con planes para más idiomas y dispositivos.
- •Google DeepMind estableció el AI Sign Language Advisory Committee e involucró a miembros de la comunidad sorda durante todo el desarrollo para asegurar un despliegue responsable.

Google DeepMind presenta el modelo de traducción de lenguaje de señas SL2T
Google DeepMind Sign Language Team
Google DeepMind está presentando sign-language-to-text (SL2T), un nuevo modelo diseñado para impulsar funciones de lenguaje de señas para usuarios sordos y con dificultades auditivas.
Durante las últimas décadas, los sistemas de IA han avanzado de manera importante en el procesamiento de lenguas habladas, lo que ha permitido la traducción automática, la dictación y las interfaces conversacionales para usuarios oyentes. Sin embargo, ese progreso no se ha extendido a las más de 200 lenguas de señas del mundo ni a los aproximadamente 70 millones de personas sordas y con dificultades auditivas que las usan.
Google DeepMind dijo que ahora lanza un modelo de traducción sign-language-to-text masivamente multilingüe que describe como un avance en calidad y generalidad. Por primera vez, la tecnología pasa del laboratorio a los productos de consumo. Aunque investigadores académicos y empresas tecnológicas han explorado el reconocimiento del lenguaje de señas durante años, la traducción de señas a texto en tiempo real ha permanecido en gran medida confinada a prototipos de investigación, lo que convierte el despliegue de SL2T en aplicaciones de consumo en un hito notable de la IA de accesibilidad. SL2T impulsa la dictación de señas a texto en Gboard y Live Transcribe en Pixel 11, comenzando con American Sign Language (ASL) a inglés. Más dispositivos llegarán pronto, y seguirán idiomas adicionales.
Al igual que la dictación por voz para usuarios oyentes, esta función permite a los usuarios sordos hacer señas a su teléfono en cualquier lugar donde normalmente escribirían. Los usuarios pueden hacer señas para buscar en la web, redactar mensajes o documentos y pedirle a Gemini que responda consultas o ejecute tareas. En Live Transcribe, los usuarios pueden responder con señas durante conversaciones en lugar de escribir de ida y vuelta. Según quienes lo probaron, hacer señas en ASL es más rápido, más natural y más agradable que escribir en inglés.
Por qué importan las lenguas de señas
Las lenguas de señas son las lenguas principales de las comunidades sordas en todo el mundo y una parte central de la identidad cultural sorda. Las personas sordas varían mucho en su nivel de dominio de la lengua de señas, el habla, la lectura y la escritura, por lo que es importante ofrecer apoyo en todas las modalidades. El procesamiento de lenguaje de señas puede beneficiar a las personas sordas de la misma manera que el procesamiento de lenguas habladas beneficia a los usuarios oyentes, y además abre nuevas posibilidades para tender puentes de comunicación entre las comunidades sordas y oyentes.
A pesar de ese potencial, el progreso en la IA para lenguaje de señas ha sido lento. Google DeepMind señaló que esto refleja tanto la dificultad técnica del trabajo como las ideas erróneas generalizadas sobre cómo funcionan las lenguas de señas.
En comparación con la transcripción de lenguas habladas, la traducción de lenguas de señas presenta dos desafíos principales. Primero, transcribir el habla consiste en realizar un mapeo secuencial de sonido a texto en la misma lengua, mientras que las lenguas de señas son lenguas naturales independientes con sus propias gramáticas y vocabularios. Como resultado, requieren traducción automática real, no un simple proceso de transformación de señas a palabras. Segundo, el modelo debe aprender a “ver” e interpretar el movimiento físico. Las lenguas de señas transmiten significado mediante movimientos simultáneos de las manos, los brazos, el torso, la cabeza y el rostro. Seguir con precisión estos elementos a altas tasas de cuadros es una tarea de visión por computadora difícil y exigente en términos computacionales.
Con este contexto, es fácil entender por qué algunos intentos tempranos de tecnología para lenguaje de señas, como los guantes para lenguaje de señas, eran fundamentalmente limitados: las lenguas de señas no son simplemente “inglés en las manos”. Requieren percepción visual compleja de movimientos corporales detallados de todo el cuerpo y traducción lingüística completa. SL2T está diseñado para ofrecer ambas cosas.
SL2T interpreta las entradas de lenguaje de señas como puntos en el cuerpo de quien hace las señas y las traduce en resultados de texto en streaming. Ejemplo del benchmark FLEURS-ASL.
Cómo funciona SL2T
Construimos SL2T combinando un enfoque centrado en el usuario y culturalmente informado con una escala masiva de datos. El modelo se entrenó con más de 100,000 horas de datos en más de 50 lenguas de señas, con aproximadamente una cuarta parte de los datos en ASL. El entrenamiento conjunto en diversos idiomas, dialectos y niveles de dominio hace que el modelo aprenda estructuras subyacentes compartidas, superando a los modelos de un solo idioma en nuestros experimentos.
Para proteger la privacidad del usuario, SL2T interpreta el lenguaje de señas como una secuencia de ubicaciones de puntos de referencia de postura en lugar de una transmisión de cámara en bruto. Un modelo en el dispositivo ( MediaPipe Holistic ) rastrea la ubicación de los puntos en la persona que hace las señas, y solo esas coordenadas geométricas se envían al servidor para la traducción, lo que permite descartar de inmediato el video original.
SL2T traduce esta secuencia de coordenadas directamente a texto, omitiendo las anotaciones intermedias conocidas como “glosses”, que se usan ampliamente en trabajos previos sobre traducción de lenguaje de señas. Los glosses no capturan aspectos no lineales de las lenguas de señas, como los marcadores no manuales y las construcciones espaciales. Traducir directamente desde los puntos de referencia elimina límites artificiales de vocabulario y permite que la calidad de la traducción escale directamente con los datos.
SL2T es el modelo de traducción de lenguaje de señas más capaz hasta la fecha según benchmarks clave como FLEURS-ASL (sd-test), que evalúa la calidad de traducción de ASL a inglés. SL2T logra una notable puntuación zero-shot de 70 BLEURT, significativamente superior a cualquier puntuación informada previamente. Pero optimizar solo los benchmarks académicos no garantiza la utilidad en aplicaciones del mundo real, así que trabajamos intensamente en aspectos prácticos como minimizar la latencia de streaming, evitar alucinaciones en entradas que no son señas, asegurar la equidad para el 10% de quienes hacen señas y son zurdos, y mejorar el rendimiento para señas con una sola mano, que se usan mientras se sostiene un smartphone con la otra mano.
Ejemplos del benchmark FLEURS-ASL. SL2T traduce con precisión ASL complejo a un inglés fluido. Persisten errores ocasionales en señas poco frecuentes, deletreo manual rápido ("prey" → "grey"), construcciones pasivas, descripciones con clasificadores (omitiendo "claws") y tiempo verbal sin contexto ("kicked off" → "start").
Construcción con la comunidad
Creemos en construir con la comunidad sorda, no solo para ella. Las perspectivas sordas han dado forma a cada etapa de este proyecto — desde la conceptualización por Sam Sepah, un empleado sordo de Google, hasta la recopilación de datos con socios sordos, la evaluación en estudios de usuarios sordos y la evaluación del impacto de la tecnología con expertos sordos.
Para orientar un despliegue responsable en el mundo real, establecimos el AI Sign Language Advisory Committee (AISLAC), que reúne a numerosas organizaciones sordas globales y expertos en la materia. A través de este modelo de gobernanza participativa, las comunidades más afectadas por nuestra tecnología influyen directamente en nuestras prioridades de desarrollo. Coautorizamos un informe conjunto de impacto para el lanzamiento de SL2T 1.0 en Gboard y Live Transcribe, detallando de forma transparente las capacidades de la tecnología y sus limitaciones actuales — un enfoque colaborativo que planeamos continuar para todos los lanzamientos importantes de lenguaje de señas.
Mirando hacia adelante
SL2T se basa en décadas de investigación fundamental en la academia y la industria, pero llevar la entrada ASL a los teléfonos de los usuarios es solo el comienzo. La misión de Google es organizar la información del mundo y hacerla universalmente accesible y útil. Lograr una accesibilidad universal significa alcanzar paridad total con las lenguas habladas y escritas. Nuestro equipo trabaja para ampliar esta tecnología a lenguas de señas adicionales, generación de lenguaje de señas y capacidades de IA de frontera. Esperamos compartir nuestro progreso de manera responsable para hacer que el acceso mediante lenguas de señas sea estándar en todo el entorno digital.
Puedes experimentar SL2T en Gboard y Live Transcribe primero en Pixel 11 , con más dispositivos próximamente — todo sin costo adicional.
Agradecimientos
Este trabajo fue realizado conjuntamente por equipos de Google DeepMind y Android. El equipo principal que desarrolló el modelo SL2T es: Garrett Tanzer, Benoit Brard, Elizabeth Clark, Tim Dozat, Sebastian Ebert, Dan Garrette, Manfred Georg, Vicky Holgate, Shankar Kumar, Mohammad Saboorian, Miloš Stanojević, Megh Umekar, John Wieting, Andy Zhang y Chris Dyer.
El equipo de Android que integró el modelo en Gboard y Live Transcribe es: Ausmus Chang, Sai Aditya Chitturu, Dayle Chiu, Anna Chou, Ajay Dudani, Angana Ghosh, Alex Huang, Joanne Kim, Ed Lee, Thomas Lin, James Su, Yanchao Su y Sharlene Yuan.
Agradecemos el apoyo adicional de Anelia Angelova, Abhishek Bapna, Sara Basson, Glenn Cameron, Scott Crowell, Trevor Cohn, Noah Fiedel, Zoubin Ghahramani, Raia Hadsell, Tom Hudson, Alexander Hauerslev Jensen, Kazuya Kawakami, Peike Li, Liam McCafferty, Caroline Pantofaru, Abhinav Parashar, Christopher Patnoe, Laura Rimell, Sam Sepah, Thad Starner, Dave Uthus y Biao Zhang.
Muchas gracias también a quienes participaron en las pruebas iniciales de nuestros modelos.