8news

Tech • IA • Robotique

VIDÉO
ENFR
Aujourd'huiShortsÀ la uneVotre topicPour vousTopicsToutes les vidéosChaînes YTArchivesRechercheFavoris

Article complet du Daily Podcast

Comment développer avec Gemini 3.5 Transcribe

Google lance son premier modèle de transcription fondé sur Gemini avec deux voies d’intégration : la transcription de fichiers audio via l’Interactions API et la transcription en temps réel via la Live API. Pour les développeurs, l’enjeu n’est pas seulement de convertir la parole en texte, mais de choisir entre un transcript final enrichi et un flux de texte à faible latence.

Généré le 27 août 2026 à 15:25 UTC1510 mots
Illustration générée par IA

Un modèle de transcription pensé pour les usages applicatifs

Google a présenté Gemini 3.5 Transcribe le 26 août 2026 comme son modèle de conversion parole-texte le plus précis à ce jour, conçu pour des interactions vocales intelligentes plutôt que pour une simple dictée brute . Le modèle vise les situations où la parole réelle est difficile à transcrire: bruit de fond, jargon métier, hésitations, autocorrections, langues mélangées et éléments alphanumériques comme les codes postaux ou les numéros de commande .

La nouveauté la plus importante pour les développeurs est l’architecture en deux accès. Google propose gemini-3.5-transcribe pour l’audio préenregistré via l’Interactions API, et gemini-3.5-transcribe-live pour la transcription continue à faible latence via la Live API . Ce choix conditionne toute la conception du produit.

Pour une application de compte rendu de réunion, de transcription d’interview, d’analyse post-appel ou d’archivage audio, le modèle standard est le point d’entrée naturel, car il travaille sur un fichier terminé et peut fournir un transcript final plus riche . Pour des sous-titres en direct, une interface vocale, un agent conversationnel ou un assistant pendant un appel, la Live API sert à recevoir du texte incrémental pendant que la personne parle .

Deux API pour deux temporalités

Dans le cas de la transcription de fichiers, la documentation de Gemini API décrit un flux simple: téléverser un fichier audio, créer une interaction avec le modèle gemini-3.5-transcribe, transmettre l’URI du fichier comme entrée audio, puis récupérer le résultat dans interaction.output_text . Cette approche convient aux pipelines où l’on préfère un résultat final de qualité à une réponse immédiate .

Ce mode donne aussi accès aux fonctions que recherchent les équipes produit, data ou conformité. Google indique que le modèle prend en charge l’identification automatique de la langue, la diarisation des locuteurs, les horodatages au niveau des mots, les indices de vocabulaire personnalisé et un mode de transcription intelligente . La documentation précise également que le modèle peut détecter automatiquement la langue ou accepter des codes BCP-47 lorsque la langue est connue à l’avance .

La Live API répond à un autre besoin. Le guide de transcription en direct explique que les développeurs peuvent se connecter par WebSocket ou avec le SDK Google Gen AI, envoyer un flux audio continu et recevoir des transcriptions textuelles incrémentales pendant la parole . Ici, le modèle est gemini-3.5-transcribe-live, avec une modalité de réponse textuelle .

Google distingue clairement cette transcription en direct d’un agent vocal complet. La Live Transcription est un pipeline de reconnaissance vocale à faible latence, tandis qu’un Live Agent écoute, raisonne et peut répondre oralement . Cette séparation est importante: un produit de sous-titrage ou de capture vocale n’a pas forcément besoin d’un agent conversationnel, tandis qu’un assistant vocal complet devra probablement combiner transcription, raisonnement et appels d’outils.

Le mode intelligent: puissant, mais à manier avec prudence

L’une des fonctions les plus visibles est la transcription intelligente. Google explique que le modèle peut supprimer les mots de remplissage, gérer les corrections prononcées à voix haute et mettre automatiquement le texte en forme . La documentation développe ce point: le mode smart optimise le texte pour la lecture, retire les hésitations, résout les corrections intégrées, structure les listes et applique la ponctuation, la casse, les dates, les devises et les nombres .

Pour la dictée quotidienne, c’est un avantage évident. L’utilisateur peut parler naturellement, revenir sur une date, corriger un prénom, puis obtenir un texte propre sans réécriture manuelle. Pour les développeurs, cela peut réduire fortement la couche de nettoyage qui suivait souvent la transcription automatique.

Mais ce confort modifie la nature du document produit. Dans un contexte juridique, journalistique, médical, scientifique ou RH, un transcript qui supprime les hésitations et reformule la parole n’est plus exactement une trace verbatim. La bonne pratique consiste donc à exposer clairement deux choix: verbatim lorsque la fidélité prime, smart lorsque le texte sert à produire des notes lisibles, un brouillon de message ou une matière de synthèse . Google précise aussi que le mode intelligent n’est pas compatible avec les horodatages granulaires ni avec la diarisation; lorsqu’il faut des mots horodatés ou des locuteurs identifiés, il faut configurer le mode verbatim .

Précision, langues et vocabulaire spécialisé

Google affirme que Gemini 3.5 Transcribe progresse par rapport à Chirp 3 et annonce un taux moyen d’erreur mot de 4,0 % en streaming et de 2,6 % en non-streaming, selon des mesures d’Artificial Analysis . L’entreprise indique aussi des résultats FLEURS de 5,50 % WER en streaming et de 5,04 % WER en non-streaming sur un ensemble de langues et variantes majeures . 9to5Google a également relevé l’affirmation de Google selon laquelle le temps jusqu’à la transcription finale s’améliore de 70 % par rapport à Chirp 3 .

Ces chiffres expliquent la cible applicative du lancement. La transcription d’un appel client, d’un rendez-vous médical ou d’une commande vocale échoue souvent sur les références exactes: code postal, identifiant, nom de produit, montant ou acronyme interne. Google met donc en avant la reconnaissance d’entités alphanumériques et la possibilité d’ajouter un vocabulaire personnalisé pour guider le modèle vers des termes rares, des noms propres ou du jargon technique .

Le support multilingue est un autre point clé. Google indique que le modèle détecte et transcrit automatiquement plus de 85 langues, avec prise en charge d’accents régionaux et de dialectes variés . La documentation liste les langues prises en charge et leurs codes BCP-47, et indique qu’un champ language_codes vide ou omis active la détection automatique et la gestion des changements de langue . Pour les applications bilingues, cela ouvre la voie à des appels de support ou réunions où les intervenants passent naturellement d’une langue à l’autre.

Comment choisir son architecture

Le premier choix de conception est simple: l’application a-t-elle besoin du texte pendant que la personne parle, ou d’un transcript final après l’enregistrement?

Si le transcript final est l’objet principal, il faut commencer par gemini-3.5-transcribe via l’Interactions API . Le développeur téléverse l’audio, transmet l’URI du fichier et choisit le mode de sortie. Il est recommandé d’ajouter tôt le custom_vocabulary pour les noms de produits, termes médicaux, codes clients ou acronymes internes . Le mode verbatim avec diarisation et horodatages convient aux usages d’audit, de recherche, de sous-titrage ou d’analyse par locuteur . Le mode smart convient davantage aux notes prêtes à relire, brouillons et textes destinés à être partagés .

Si la faible latence est prioritaire, le bon point de départ est gemini-3.5-transcribe-live avec la Live API . Le guide montre une session persistante avec response_modalities configuré en texte et input_audio_transcription paramétré pour la détection automatique ou les indices de langue . Pour les applications web ou mobiles qui envoient directement le flux du micro, Google recommande des jetons éphémères afin de ne pas exposer une clé API durable côté client .

Les entreprises disposent aussi d’un chemin via Gemini Enterprise Agent Platform. La documentation Google Cloud décrit des modèles en préversion pour la transcription en direct et la transcription synchrone, avec des fonctions comme la détection de langue, le vocabulaire personnalisé, la mise en forme intelligente, la diarisation et des limites de durée selon l’endpoint et les options activées . Ce canal intéressera surtout les organisations qui veulent des contrôles de projet Google Cloud, une gouvernance d’entreprise et des déploiements encadrés .

Un modèle déjà visible dans les produits Google

Gemini 3.5 Transcribe n’est pas seulement une API. Google indique que des capacités vocales liées au modèle sont déjà visibles dans Rambler sur Android et dans l’application Gemini pour macOS, tandis que les développeurs peuvent commencer via Gemini API dans Google AI Studio et Gemini Enterprise Agent Platform . 9to5Google rapporte aussi que le modèle alimente Gboard Rambler, apparaît dans Gemini pour macOS et Google Antigravity, et doit ensuite arriver dans Chrome pour la saisie vocale dans les champs web .

Cette présence dans les produits grand public donne une indication stratégique. Google ne présente pas la transcription comme une simple brique d’arrière-plan, mais comme une couche d’interface pour dicter, éditer, piloter des agents, interagir avec des documents et capter l’intention en temps réel.

Ce qu’il faut retenir

Développer avec Gemini 3.5 Transcribe consiste d’abord à choisir la bonne temporalité. L’Interactions API sert aux fichiers audio, aux transcriptions finales et aux métadonnées comme les locuteurs ou les horodatages. La Live API sert aux flux audio continus et aux interfaces qui doivent réagir pendant que l’utilisateur parle.

Le deuxième choix est éditorial: smart pour produire un texte propre, verbatim pour conserver la trace exacte. Les meilleurs produits ne se contenteront pas de remplacer un ancien moteur speech-to-text. Ils exploiteront la différence entre parole brute, dictée lisible, transcript structuré et capture d’intention en temps réel.

Commentaires

Sois le premier à commenter.

Sources des dernières 72 heures

  1. [1]Intelligent transcription with Gemini 3.5 Transcribe26 août 2026, 00:00 UTC
  2. [2]Live transcription with Gemini Live API | Gemini API | Google AI for Developers26 août 2026, 00:00 UTC
  3. [3]Gemini 3.5 Audio (Live Translate, Transcribe, Transcribe Live)26 août 2026, 00:00 UTC
  4. [4]Google launches Gemini 3.5 Transcribe, which powers Gboard Rambler & is coming to Chrome26 août 2026, 17:00 UTC
  5. [5]Audio transcription | Gemini API | Google AI for Developers26 août 2026, 00:00 UTC

Article généré par IA à partir d’une recherche web récente, puis conservé comme instantané éditorial daté.