Un modèle qui observe plus que les mains
La fonction Sign-to-Text du Pixel 11 transforme la langue des signes américaine en phrases écrites en temps réel. Elle s’appuie sur un modèle multilingue développé par Google DeepMind.Le système analyse la forme et la position des mains, mais aussi les expressions du visage et les mouvements du corps. Ces éléments sont indispensables pour interpréter correctement une langue visuelle complète.
Une intégration dans Gboard et Live Transcribe
L’utilisateur ajoute Sign-to-Text à la barre d’outils de Gboard, puis signe face à la caméra avant. Le texte traduit apparaît sur l’écran extérieur de l’appareil compatible.La fonction peut être utilisée pour composer des messages dans différentes applications. Elle fonctionne également avec Live Transcribe, ce qui élargit les situations de conversation entre personnes sourdes et entendantes.
Un outil développé avec la communauté sourde
Google indique avoir travaillé avec des membres de la communauté sourde afin d’adapter le produit aux gestes réels et aux attentes quotidiennes. La prise en charge inclut les signes à une main et à deux mains.Cette collaboration est importante, car une traduction utile ne se résume pas à reconnaître une suite de positions. Elle doit tenir compte du rythme, de la grammaire visuelle et de la diversité des manières de signer.
Une avancée encore limitée à l’ASL
Le lancement concerne la langue des signes américaine et la gamme Pixel 11. Les autres langues des signes possèdent leur propre vocabulaire et leur propre grammaire ; elles nécessiteront donc des données et des validations spécifiques.La fonction représente néanmoins une étape notable vers des échanges plus fluides. Son efficacité devra être évaluée dans des environnements variés, avec des éclairages, des cadrages et des styles de communication différents.Source officielle et crédit image : Google Blog — traduction Sign-to-
Text sur Pixel 11.