Aux États-Unis, Google renforce Google Traduction sur Android avec un mode d’écoute inédit, pensé pour les conversations sans écouteurs.
Google déploie une nouvelle fonction de traduction vocale en temps réel directement dans Google Traduction sur Android. Comme le détaille le site américain 9to5Google, ce « mode écoute » permet de suivre une conversation étrangère en collant simplement son smartphone à l’oreille, comme lors d’un appel classique.
Un nouveau modèle Gemini pour la traduction voix-à-voix en direct
Au cœur de cette évolution, Google met en avant un nouveau modèle de traduction baptisé Gemini 3.5 Live Translate. Ce système de voix-à-voix est conçu pour traduire un discours oral dans une autre langue quasiment en continu, sans repasser par du texte intermédiaire visible pour l’utilisateur.
Selon 9to5Google, Gemini 3.5 Live Translate reconnaît plus de 70 langues et produit une voix traduite présentée comme « fluide » et « naturelle ». L’accent est mis sur la restitution de la prosodie : intonation, rythme et hauteur de la voix sont pris en compte afin de rendre le résultat plus agréable à écouter et moins robotique.
Gemini 3.5 Live Translate génère la parole traduite en continu, avec l’objectif de rester à seulement quelques secondes de retard par rapport à l’orateur tout en conservant une bonne qualité de traduction.
Google oppose ce système aux traducteurs classiques dits « tour par tour », qui attendent la fin de chaque phrase avant de proposer une traduction. Ici, l’audio ne s’interrompt pas brutalement à chaque fin de segment. Le modèle tente au contraire de trouver un équilibre entre la nécessité de disposer d’un minimum de contexte et la volonté de rester le plus possible synchronisé avec l’interlocuteur.
Le « mode écoute » : le téléphone collé à l’oreille, sans écouteurs
Jusqu’ici, l’usage le plus naturel de Gemini 3.5 Live Translate passait par des écouteurs, afin d’entendre la traduction dans sa langue sans gêner les personnes autour. Google commence à déployer cette technologie directement dans l’application Google Traduction sur Android et iOS, avec un bouton « Live translate » situé en bas à gauche de l’écran lorsqu’on porte un casque audio ou des écouteurs.
Sur Android, une nouveauté vient cependant faciliter l’usage dans la vie quotidienne : le « mode écoute ». Il s’agit d’une façon de rediriger la traduction audio non plus vers un casque, mais vers l’écouteur d’oreille intégré au téléphone, celui qui sert habituellement lors d’un appel vocal.
Avec ce mode, l’utilisateur peut simplement porter son smartphone à l’oreille « comme lors d’un appel normal » pour écouter la traduction en direct.
Le principe est simple : vous tenez votre téléphone contre votre oreille, l’application capte la voix étrangère via le micro, traduit le flux en continu avec Gemini 3.5 Live Translate, puis vous restitue la traduction dans votre langue, de manière discrète. Dans un lieu public ou bruyant, le système évite d’utiliser le haut-parleur externe et rend les échanges plus confidentiels.
Pour un voyageur, cette fonction vise des situations très concrètes : une discussion rapide à la réception d’un hôtel, un échange dans un magasin ou un renseignement demandé à un passant, sans forcément avoir des écouteurs sous la main.
Comment ce mode modifie l’usage de la traduction instantanée
Le fait de pouvoir coller le téléphone à l’oreille rapproche la traduction automatique d’un geste que tout le monde connaît déjà : répondre à un appel. Au lieu de tendre le smartphone à son interlocuteur ou de lire un texte traduit, l’utilisateur écoute une voix de synthèse qui lui murmure la version traduite, tout en restant debout face à la personne qui parle.
Techniquement, l’application doit gérer en parallèle l’écoute du micro, la génération de la traduction et sa lecture immédiate dans l’écouteur. L’utilisateur n’a pas à intervenir en continu : une fois le mode lancé, l’app suit la conversation jusqu’à ce qu’il mette fin à la session.
Des réunions traduites en direct dans Google Meet
Gemini 3.5 Live Translate ne se limite pas à Google Traduction. Google commence aussi à intégrer ce modèle au sein de Google Meet, son service de visioconférence grand public et professionnel.
Jusqu’à présent, la traduction orale dans Google Meet se cantonnait à cinq langues. Avec Gemini 3.5 Live Translate, 9to5Google indique que la prise en charge de plus de 70 langues ouvre la porte à plus de 2000 combinaisons de langues différentes au sein d’une même réunion. L’outil ne se contente plus de traduire « vers » et « depuis » l’anglais, mais permet de relier directement différents couples de langues.
Sur le web, un nouveau bouton apparaît dans la barre de contrôles de Google Meet pour activer immédiatement la traduction de la parole en direct pendant un appel vidéo.
Dans un premier temps, cette fonction arrive dans une phase dite de « preview privée » pour certains clients professionnels de Google Workspace, la suite de services en ligne dédiée aux entreprises. Une ouverture plus large est annoncée pour plus tard dans l’année, sans date précise.
Une version test pour les développeurs et les services tiers
Gemini 3.5 Live Translate n’est pas réservé aux produits grand public de Google. Le modèle est aussi proposé en test public pour les développeurs via Gemini Live API et l’interface Google AI Studio.
Concrètement, des éditeurs tiers peuvent commencer à expérimenter la traduction de voix en direct dans leurs propres applications, qu’il s’agisse d’outils d’apprentissage des langues, de plateformes de réunion ou de services d’assistance vocale. Ces accès restent présentés comme des avant-premières, susceptibles d’évoluer fréquemment.
Une protection audio invisible grâce au marquage SynthID
La montée en puissance de la traduction vocale automatique soulève des questions de sécurité et de désinformation, notamment lorsqu’il devient possible de générer de longues séquences audio avec une voix de synthèse proche de la voix humaine.
Pour répondre à ce risque, Google explique que tout l’audio produit par Gemini 3.5 Live Translate est marqué grâce à SynthID. Ce système ajoute un filigrane imperceptible directement dans le signal sonore.
Ce marquage discret permet de détecter a posteriori qu’un fichier audio a été généré par une IA, afin de limiter les usages malveillants et la diffusion de fausses informations.
Le filigrane n’est pas audible pour l’utilisateur, mais il offre à Google ou à des partenaires autorisés un moyen technique d’identifier une sortie générée par l’algorithme. L’objectif affiché est de rendre plus difficile la présentation d’un enregistrement synthétique comme une vraie prise de son d’une personne réelle.
Quelles utilisations possibles pour un mobinaute en France ?
Pour un utilisateur de smartphone en France, ce « mode écoute » intégré à Google Traduction sur Android vise des usages très concrets lors de déplacements à l’étranger. Le téléphone devient une sorte d’interprète discret, capable d’aider à comprendre un interlocuteur sans afficher de texte ou de traductions à l’écran.
Dans les transports, au restaurant ou dans un commerce, l’utilisateur peut garder le téléphone près de l’oreille et suivre la traduction, ce qui limite l’effet « gadget » d’une conversation tenue via le haut-parleur et l’écran. Le geste se rapproche d’un coup de fil classique.
En France, il existe déjà des outils de traduction vocale instantanée, notamment via les applications mobiles ou certaines fonctions intégrées aux écouteurs connectés. La différence mise en avant par Google concerne la continuité de la traduction, la prise en charge d’un grand nombre de langues et ce mode discret par l’écouteur d’appel, sans accessoire.
Ce que cela change par rapport aux outils déjà connus
La plupart des services actuels fonctionnent encore sur un schéma séquentiel : on parle, on attend la traduction, puis on répond. Gemini 3.5 Live Translate cherche à se rapprocher d’une conversation plus naturelle, avec des pauses moins marquées entre les interlocuteurs.
Pour un Français qui maîtrise peu l’anglais ou d’autres langues étrangères, la promesse est de suivre des échanges plus longs, comme un briefing professionnel ou un échange détaillé avec un prestataire, tout en gardant une bonne fluidité.
Atouts pratiques et limites possibles de ce « mode écoute »
Cette nouvelle fonction reste dépendante de plusieurs paramètres : la qualité de la connexion, le niveau de bruit ambiant, la clarté de la diction et la langue parlée. Comme tous les traducteurs automatiques, Gemini 3.5 Live Translate peut se montrer moins fiable sur l’argot, les accents très marqués ou les expressions très locales.
Dans un environnement professionnel, le recours à ce type d’outil doit rester encadré. Une traduction automatique ne remplace pas un interprète humain pour des discussions sensibles ou des documents contractuels. Le système peut toutefois rendre service pour des échanges informels ou pour lever un premier obstacle linguistique avant, si besoin, de faire appel à un spécialiste.
Conversations de voyage : demande d’itinéraire, réservation, échange avec un commerçant.
Situations d’urgence : comprendre des consignes de base dans une langue non maîtrisée.
Réunions simples : suivre le sens général d’une discussion multilingue.
Dans tous les cas, l’utilisateur doit garder en tête qu’une traduction automatique peut comporter des approximations. Pour les décisions importantes, une vérification auprès d’un locuteur natif ou d’un professionnel reste recommandée.
Vers des usages combinés avec d’autres outils d’IA
À terme, la combinaison de la traduction vocale continue et d’autres briques d’IA, comme la transcription écrite ou les résumés automatiques, pourrait devenir courante. Un participant à une réunion en ligne pourrait ainsi écouter une traduction en direct, puis recevoir un compte rendu synthétique dans sa langue à l’issue de l’appel.
Pour l’instant, Google met surtout en avant la dimension pratique de ce « mode écoute » dans Google Traduction sur Android : transformer un smartphone en oreillette de traduction instantanée, accessible en quelques gestes, sans câbles ni accessoires supplémentaires. Reste à voir comment les utilisateurs français s’approprieront ce nouveau réflexe lors de leurs prochains déplacements à l’étranger.
Lecture rapide : rédactrice en chef d’Eurotel, ancienne de l’hôtellerie, spécialiste des hôtels de caractère et des city-trips.
Hélène Vasseur a passé près de quinze ans dans l’hôtellerie avant de se consacrer à l’écriture. De la réception d’un palace lyonnais à la direction d’une maison d’hôtes, elle a appris à lire un hôtel de l’intérieur : ce qui fait une vraie adresse, et ce qui relève du décor.
Rédactrice en chef d’Eurotel, elle coordonne la ligne éditoriale et arpente l’Europe à la recherche d’hôtels de caractère et de destinations à raconter autrement. Sa conviction : on voyage mieux quand on comprend les lieux, pas seulement quand on les coche. Elle garde un faible pour les vieilles villes d’Europe centrale et les petits-déjeuners qui s’éternisent.
Comment fonctionne le « mode écoute » de Google Traduction ?
L'utilisateur porte son smartphone à l'oreille comme lors d'un appel normal. L'application capte la voix étrangère via le micro, traduit le flux en continu avec Gemini 3.5 Live Translate, puis restitue la traduction dans l'écouteur intégré du téléphone de manière discrète.
Quels sont les avantages de Gemini 3.5 Live Translate par rapport aux traducteurs classiques ?
Contrairement aux traducteurs « tour par tour » qui attendent la fin de chaque phrase, Gemini 3.5 Live Translate génère la traduction en continu avec un retard de quelques secondes à peine, en préservant l'intonation, le rythme et la hauteur de la voix pour un résultat plus naturel et moins robotique.
Combien de langues Gemini 3.5 Live Translate supporte-t-il ?
Le modèle reconnaît plus de 70 langues, ce qui ouvre la porte à plus de 2000 combinaisons de langues différentes au sein d'une même réunion sur Google Meet, sans se limiter à la traduction vers et depuis l'anglais.
Qu'est-ce que SynthID et à quoi sert-il ?
SynthID est un système qui ajoute un filigrane imperceptible dans l'audio généré par l'IA, permettant de détecter a posteriori qu'un fichier audio a été synthétisé. Cela vise à limiter les usages malveillants et la diffusion de fausses informations.
Quand cette fonction sera-t-elle disponible pour tous les utilisateurs ?
Le « mode écoute » est actuellement en déploiement sur Android, tandis que l'intégration dans Google Meet commence par une phase de « preview privée » pour certains clients Google Workspace, avec une ouverture plus large annoncée pour plus tard dans l'année.