SL2T: Google lanza IA para entender lenguaje de signos

⏱ Tiempo de lectura: 3 min
Google DeepMind presentó SL2T, un modelo de inteligencia artificial diseñado para traducir lenguaje de signos a texto. El lanzamiento busca incluir a aproximadamente 70 millones de personas sordas o con problemas de audición en la revolución de la IA. SL2T debuta en el Pixel 11 con funciones de dictado por signos en Gboard y Live Transcribe, inicialmente compatible con lenguaje de signos estadounidense (ASL).
Un modelo entrenado con más de 100 mil horas de datos
Google entrenó SL2T con más de 100 mil horas de datos de lenguaje de signos abarcando 50 idiomas de signos diferentes, de las cuales aproximadamente el 25 por ciento corresponde a comunicaciones en ASL. La decisión de entrenar el modelo en múltiples lenguas de signos permitió que el sistema identifique patrones estructurales compartidos entre ellas, superando significativamente el desempeño de modelos anteriores. Este enfoque multilingüe es clave para la generalización del modelo y su capacidad de adaptación futura. El modelo utiliza MediaPipe Holistic, una herramienta de visión por computadora que funciona completamente en el dispositivo para proteger la privacidad del usuario.
Características técnicas y rendimiento confirmado
MediaPipe Holistic rastrea coordenadas geométricas de la cara, manos, brazos y torso del usuario, enviando solo esas coordenadas al servidor en la nube en lugar de video real, garantizando mayor velocidad y seguridad. SL2T traduce secuencias directamente a texto sin anotaciones intermedias (glosses), lo que permite capturar expresiones no manuales y estructuras gramaticales espaciales propias del ASL. El modelo logró una puntuación de 70 BLEURT en el benchmark FLEURS-ASL. Google incluyó optimizaciones para reducir latencia, mecanismos de prevención de alucinaciones, y soporte para usuarios zurdos y de una sola mano. Los usuarios pueden realizar búsquedas web, redactar correos, editar documentos e interactuar con Gemini usando SL2T.
Qué falta por confirmar
Google planea expandir SL2T a lenguajes de signos adicionales y desarrollar modelos para generación de lenguaje de signos en el futuro. La compañía estableció el Comité Asesor de Lenguaje de Signos de IA en asociación con organizaciones sordas y expertos para guiar el despliegue responsable de la tecnología. El comité coautorizará un reporte con Google que describe las capacidades y limitaciones actuales del modelo.
| Dato | Detalle |
|---|---|
| Modelo | SL2T (Sign Language-to-Text) |
| Lenguaje inicial | Lenguaje de Signos Estadounidense (ASL) |
| Datos de entrenamiento | Más de 100 mil horas de video en 50 lenguajes de signos |
| Datos ASL | Aproximadamente 25 mil horas (25% del total) |
| Plataforma de lanzamiento | Google Pixel 11 |
| Aplicaciones integradas | Gboard (dictado), Live Transcribe (llamadas) |
| Tecnología de privacidad | MediaPipe Holistic (procesamiento en dispositivo) |
| Benchmark | 70 BLEURT en FLEURS-ASL |
| Funciones compatibles | Búsquedas web, redacción de correos, edición de documentos, interacción con Gemini |
| Soporte de usuarios | Zurdos y usuarios de una sola mano |
| Roadmap | Expansión a lenguajes de signos adicionales; generación de lenguaje de signos en desarrollo |
| Gobernanza | Comité Asesor de Lenguaje de Signos de IA con organizaciones sordas |
Preguntas frecuentes sobre SL2T
¿Cuál es la diferencia entre SL2T y los modelos de lenguaje de signos anteriores?
SL2T es el primer modelo disponible en un producto de consumidor real. Fue entrenado en 50 lenguajes de signos para aprender patrones compartidos, lo que le permite superar significativamente modelos previos. Traduce directamente a texto sin anotaciones intermedias, capturando expresiones no manuales y gramática espacial propia del ASL.
¿En qué dispositivos está disponible SL2T?
SL2T debuta en Google Pixel 11. Se integra en Gboard para dictado mediante signos y en Live Transcribe para transcripción en llamadas. Google no ha especificado en la fuente si llegará a otros dispositivos o sistemas operativos.
¿Cómo protege SL2T la privacidad del usuario?
MediaPipe Holistic procesa el video directamente en el dispositivo, extrayendo solo coordenadas geométricas (cara, manos, brazos, torso) que se envían al servidor en la nube. No se sube video real, garantizando mayor privacidad y velocidad de procesamiento.
La lectura para quienes usan IA a diario
SL2T representa un giro significativo: por primera vez, una comunidad de 70 millones de personas tiene acceso a una herramienta de IA comparable a la que disfrutan quienes usan voz en decenas de idiomas. El enfoque de Google en privacidad mediante procesamiento en dispositivo y la inclusión de comunidades sordas en la gobernanza establece un precedente importante para desarrollo responsable.
En Inteligencia Artificial vemos en SL2T un avance que trasciende la tecnología: reconoce que la IA debe servir a todos, no solo a mayorías. ¿Cuántos otros grupos de usuarios han estado excluidos de innovaciones que hoy damos por obvias?
Fuente: siliconangle.com

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.