Google DeepMind presentó el 12 de agosto de 2026 SL2T, un modelo de traducción de lenguaje de signos a texto diseñado para llevar esta tecnología desde el laboratorio a productos de consumo. La primera implementación permite traducir American Sign Language (ASL) a inglés mediante funciones de dictado en Gboard y Live Transcribe, disponibles inicialmente en Pixel 11. La compañía señala que prepara la llegada a más dispositivos y lenguajes.
Con esta función, los usuarios pueden signar en el teléfono en cualquier lugar donde normalmente escribirían. Entre los usos descritos por Google DeepMind están buscar en la web, redactar mensajes o documentos y pedir a Gemini que responda consultas o ejecute tareas. En Live Transcribe, la herramienta también permite signar respuestas durante una conversación, en lugar de escribirlas. Según las pruebas realizadas por la empresa, los participantes consideraron que signar en ASL era más rápido y natural que escribir en inglés.
Google DeepMind destaca que los lenguajes de signos son idiomas naturales independientes, con sus propias gramáticas y léxicos. Por ello, su traducción requiere un proceso de traducción automática, no una conversión secuencial de signos a palabras. Además, el significado se expresa mediante movimientos simultáneos de manos, brazos, torso, cabeza y rostro, lo que obliga al modelo a interpretar información visual corporal con gran precisión.
SL2T se entrenó con más de 100.000 horas de datos procedentes de más de 50 lenguajes de signos, con aproximadamente una cuarta parte del material en ASL. Google DeepMind afirma que el entrenamiento conjunto con diferentes lenguajes, dialectos y niveles de competencia permite aprender estructuras compartidas y superar, en sus experimentos, el rendimiento de modelos entrenados para un solo idioma.
El sistema no utiliza directamente la imagen de la cámara para realizar la traducción. Un modelo ejecutado en el dispositivo, MediaPipe Holistic, identifica la posición de distintos puntos del cuerpo de la persona que signa. Solo esas coordenadas geométricas se envían al servidor para la traducción, mientras que el vídeo original se descarta inmediatamente, según la compañía.
SL2T traduce directamente la secuencia de coordenadas a texto y evita pasar por las anotaciones intermedias conocidas como “glosses”, habituales en trabajos anteriores. Google DeepMind sostiene que estas anotaciones no representan adecuadamente elementos no manuales y construcciones espaciales propias de los lenguajes de signos. La traducción directa desde los puntos corporales también elimina límites artificiales de vocabulario, de acuerdo con la explicación del equipo.
En el banco de pruebas FLEURS-ASL (sd-test), que evalúa la traducción de ASL a inglés, SL2T obtuvo una puntuación cero-shot de 70 BLEURT. Google DeepMind la presenta como una cifra superior a cualquier resultado comunicado anteriormente en ese benchmark. La empresa también trabajó en aspectos orientados al uso cotidiano, como reducir la latencia durante la transmisión, evitar alucinaciones cuando no hay una persona signando y mejorar el rendimiento con usuarios zurdos, que representan alrededor del 10% de quienes signan.
El equipo abordó asimismo el signado con una sola mano, una situación habitual cuando la persona sostiene el teléfono con la otra. Los ejemplos publicados muestran que el modelo puede producir traducciones fluidas de frases complejas en ASL, aunque todavía comete errores con signos poco frecuentes, deletreo rápido con los dedos, construcciones pasivas, clasificadores y tiempos verbales que necesitan contexto.
Google DeepMind afirma que el proyecto se desarrolló con participación de la comunidad sorda. Sus perspectivas influyeron en distintas fases, desde la conceptualización a cargo de Sam Sepah, un empleado sordo de Google, hasta la recopilación de datos con colaboradores sordos, los estudios con usuarios y la evaluación del impacto por expertos sordos. La compañía también estableció el AI Sign Language Advisory Committee para orientar el despliegue de la tecnología en entornos reales.
Fuente: Google DeepMind.