SL2T : l'IA de Google DeepMind qui traduit la langue des signes directement sur votre téléphone

SL2T : l'IA de Google DeepMind qui traduit la langue des signes directement sur votre téléphone

Communiquer en langue des signes avec une personne qui ne la maîtrise pas relève souvent du casse-tête : il faut passer par l’écrit, un interprète ou une gymnastique de gestes approximatifs. Le 12 août 2026, Google DeepMind a présenté une réponse technologique à cette barrière quotidienne : SL2T, pour « sign language to text », un modèle d’intelligence artificielle qui traduit la langue des signes en texte, en direct, sur un simple smartphone. C’est la première fois que ce type d’outil quitte les laboratoires pour s’intégrer à des applications que des millions de personnes utilisent déjà.

Qu’est-ce que SL2T ?

SL2T est un modèle de traduction conçu par les équipes de Google DeepMind pour convertir des signes en texte écrit. Concrètement, une personne sourde ou malentendante peut signer face à la caméra de son téléphone, et l’IA retranscrit ses gestes en phrases lisibles à l’écran. L’outil est d’abord déployé pour traduire la langue des signes américaine (ASL) vers l’anglais, au sein de deux applications : le clavier Gboard et l’application d’accessibilité Live Transcribe.

Les usages sont immédiats et concrets. Via Gboard, on peut signer pour lancer une recherche sur le web, rédiger un message, écrire un document ou encore poser une question à l’assistant Gemini. Dans Live Transcribe, l’intérêt est encore plus parlant : la personne sourde signe sa part de la conversation, pendant que la parole de son interlocuteur entendant est, elle, retranscrite en texte. On obtient ainsi un véritable échange bidirectionnel, sans clavier ni papier. Autre bonne nouvelle : la fonctionnalité est proposée sans frais supplémentaires, dans un premier temps sur le Pixel 11.

Comment ça marche ?

Derrière SL2T se cache une chaîne technique astucieuse, pensée à la fois pour la performance et pour la protection de la vie privée. Le point d’entrée n’est pas la vidéo brute, mais un modèle de vision par ordinateur baptisé MediaPipe Holistic, qui tourne directement sur l’appareil. Ce composant analyse l’image en temps réel et repère la position géométrique de dizaines de points clés répartis sur le visage, les mains, les bras et le torse de la personne qui signe.

Plutôt que d’envoyer une vidéo de l’utilisateur vers les serveurs de Google, le téléphone ne transmet que les coordonnées de ces points, c’est-à-dire une représentation abstraite du mouvement. C’est cette suite de coordonnées qui est ensuite traitée dans le cloud par le modèle SL2T pour produire le texte. Ce choix d’architecture répond frontalement à l’une des grandes inquiétudes des utilisateurs : aucune image ni vidéo réelle de leur visage ou de leurs gestes n’a besoin de quitter le téléphone.

Côté apprentissage, la performance repose sur un volume de données considérable. Le modèle a été entraîné sur plus de 100 000 heures de contenu couvrant plus de 50 langues des signes différentes. Sur le banc d’essai de référence FLEURS-ASL, SL2T atteint un score de 70 BLEURT — une métrique qui évalue la qualité de la traduction —, nettement au-dessus des modèles précédents. Autrement dit, la traduction produite est jugée sensiblement plus fidèle et plus naturelle que ce que l’on savait faire jusqu’ici.

Un enjeu majeur d’accessibilité

Au-delà de la prouesse technique, SL2T touche à un sujet de société essentiel : l’accessibilité. Dans le monde, des dizaines de millions de personnes utilisent une langue des signes comme mode de communication principal. Or les langues des signes sont des langues à part entière, avec leur grammaire, leur syntaxe et leurs nuances : ce ne sont pas de simples traductions gestuelles mot à mot de l’oral. Cette richesse explique d’ailleurs pourquoi leur traduction automatique a longtemps résisté aux progrès de l’IA.

Pour une personne sourde, pouvoir signer à son téléphone pour effectuer une recherche, écrire un courriel ou dialoguer avec une personne entendante représente un gain d’autonomie concret. Cela réduit la dépendance à un interprète humain, pas toujours disponible ni finançable, et fluidifie une multitude d’interactions du quotidien : un rendez-vous administratif, un achat en boutique, un échange avec un collègue. En intégrant la fonction à des outils déjà installés sur des millions d’appareils plutôt que dans une application spécialisée isolée, Google cherche aussi à banaliser l’accessibilité, à la faire entrer dans les usages ordinaires.

Des limites qu’il faut garder en tête

Aussi impressionnant soit-il, SL2T n’est pas une baguette magique, et plusieurs réserves méritent d’être posées.

La première tient à la couverture linguistique. Malgré un entraînement sur plus de 50 langues des signes, l’outil ne prend en charge, au lancement, que la traduction de l’ASL vers l’anglais. Les autres langues des signes, dont la langue des signes française (LSF), ne sont pas encore couvertes par cette première mouture. Une personne signant en LSF ne pourra donc pas, pour l’heure, bénéficier de la fonctionnalité.

La deuxième limite est d’ordre technique et matériel. Le déploiement initial cible le Pixel 11, ce qui suppose un appareil récent et une bonne caméra. Comme tout système de vision par ordinateur, SL2T reste par ailleurs sensible aux conditions réelles : un mauvais éclairage, un cadrage approximatif, un arrière-plan chargé ou des signes très rapides peuvent dégrader la qualité de la reconnaissance.

Il faut enfin rappeler que la traduction s’effectue pour partie dans le cloud. Si l’approche par points clés limite fortement l’exposition des données personnelles, elle suppose malgré tout une connexion et un traitement distant, ce qui pose les questions habituelles de confidentialité et de disponibilité du service. Enfin, aucune traduction automatique n’égale encore la finesse d’un interprète humain : SL2T doit être vu comme un formidable outil du quotidien, pas comme un remplaçant de l’interprétation professionnelle dans les situations sensibles, médicales ou juridiques.

Une étape, pas un aboutissement

Avec SL2T, Google DeepMind signe une avancée notable : faire passer la traduction de la langue des signes du stade expérimental à celui d’un service intégré, gratuit et respectueux de la vie privée. L’ambition affichée est d’élargir progressivement la couverture linguistique et les appareils compatibles. Si cette trajectoire se confirme, l’outil pourrait devenir un allié précieux pour l’inclusion des personnes sourdes et malentendantes — à condition de rester lucide sur ce qu’il sait faire, et sur ce qu’il ne remplace pas.

Ce qu’il faut retenir

  • SL2T est un modèle d’IA de Google DeepMind, dévoilé le 12 août 2026, qui traduit la langue des signes en texte directement sur smartphone, intégré à Gboard et Live Transcribe.
  • Il repose sur MediaPipe Holistic, un modèle embarqué qui n’envoie que des coordonnées de points clés (visage, mains, bras, torse) et non des vidéos, pour préserver la vie privée.
  • Entraîné sur plus de 100 000 heures et 50 langues des signes, il atteint 70 BLEURT sur le benchmark FLEURS-ASL, bien au-dessus des modèles précédents.
  • L’enjeu est l’accessibilité et l’autonomie des personnes sourdes et malentendantes, avec un service gratuit intégré à des applications grand public.
  • Ses limites : prise en charge limitée à l’ASL vers l’anglais (pas de LSF au lancement), dépendance au matériel récent et au cloud, et sensibilité aux conditions de captation ; ce n’est pas un substitut à l’interprétation humaine.
Publicité