8news

Tech • IA • Robotique

VIDÉO
ENFR
Aujourd'huiShortsÀ la uneVotre topicPour vousTopicsToutes les vidéosChaînes YTArchivesRechercheFavoris

Article complet du Daily Podcast

Construire avec Gemini 3.5 Transcribe : sous-titres en direct, audio enregistré et transcription intelligente

Le nouveau modèle de transcription fondé sur Gemini propose deux chemins de développement : l’API Interactions pour l’audio enregistré et l’API Live pour les flux en temps réel. L’enjeu dépasse la reconnaissance vocale : il s’agit de concevoir des agents vocaux, des sous-titres, des comptes rendus et des outils multilingues avec une couche de parole plus structurée.

Généré le 27 août 2026 à 01:35 UTC1529 mots

Ce que Google vient de lancer

Google présente Gemini 3.5 Transcribe comme son nouveau modèle de conversion parole-texte, destiné aux développeurs qui construisent des interfaces vocales, des outils de sous-titrage et des chaînes d’analyse après appel . Le modèle est disponible en préversion publique pour les développeurs via l’API Gemini dans Google AI Studio et Google Antigravity, tandis que les entreprises peuvent y accéder via Gemini Enterprise Agent Platform . Google indique que la technologie alimente déjà des expériences grand public, dont Rambler sur Android et l’application Gemini sur macOS, avec une arrivée annoncée dans Chrome .

Le changement important est que la transcription n’est plus seulement présentée comme une brique ASR classique. Gemini 3.5 Transcribe est décrit comme un modèle de transcription basé sur Gemini, capable de transformer l’audio brut en texte plus propre et formaté, avec une meilleure prise en charge du bruit, du jargon, des autocorrections et des hésitations . Pour une équipe produit, la première question devient donc: faut-il une trace littérale, un texte lisible ou un flux incrémental en direct?

Choisir la bonne API

Deux surfaces Gemini API sont à distinguer. Pour l’audio préenregistré, il faut utiliser gemini-3.5-transcribe via l’API Interactions; pour le temps réel, il faut utiliser gemini-3.5-transcribe-live via l’API Live . La page du modèle confirme ces deux versions: un endpoint unary gemini-3.5-transcribe et une version Live API nommée gemini-3.5-transcribe-live .

Le chemin pour les fichiers enregistrés accepte jusqu’à une heure d’audio, mais la limite tombe à 30 minutes lorsque la diarisation des locuteurs ou les horodatages au mot près sont activés . Les sessions de transcription en direct sont limitées à 10 minutes et ne prennent pas en charge les horodatages mot par mot ni la diarisation, ce qui les rend plus adaptées aux sous-titres, à la dictée et aux interfaces temps réel qu’aux transcriptions d’archive . La même page précise que le modèle Gemini Developer API ne prend pas en charge Batch API, Flex inference ni Priority inference, un point important pour ne pas confondre traitement de fichiers et véritable infrastructure batch .

Côté Gemini Enterprise Agent Platform, la documentation Google Cloud utilise des identifiants avec suffixe de préversion: gemini-3.5-transcribe-preview pour la transcription synchrone et gemini-3.5-transcribe-live-preview pour le streaming . Cette page d’entreprise indique une disponibilité globale et une limite de 15 minutes pour les fichiers dans sa documentation de préversion, plus restrictive que la limite d’une heure affichée pour Gemini Developer API; les équipes doivent donc vérifier les limites sur la plateforme exacte qu’elles déploient .

Concevoir une chaîne pour l’audio enregistré

Une chaîne de transcription de fichiers commence par l’ingestion. Le guide Google explique le schéma attendu: téléverser un fichier audio, transmettre l’URI et le type MIME retournés à une requête Interactions API, puis sélectionner le modèle gemini-3.5-transcribe . Pour un outil interne simple, cela suffit souvent: téléverser l’enregistrement, récupérer output_text, le stocker, puis lancer séparément un résumé ou une extraction structurée.

En production, il faut choisir tôt entre les modes verbatim et smart. Le mode verbatim, activé par défaut, conserve les mots de remplissage, les répétitions, les pauses et les faux départs, alors que le mode smart retire les disfluences, résout les corrections en ligne et formate les listes, dates, devises et nombres . Ce choix est fonctionnel: une transcription juridique ou de conformité exigera souvent le verbatim, tandis qu’une note CRM ou un compte rendu clinique gagnera à être nettoyé.

La diarisation et les horodatages appartiennent surtout au parcours enregistré. Le guide précise que la diarisation étiquette les locuteurs, que les horodatages au mot donnent des offsets de début et de fin, et que ces paramètres se configurent dans le mode verbatim . Le mode smart n’est pas compatible avec les granularités d’horodatage ni la diarisation, ce qui pousse les applications robustes à produire deux sorties: une trace fidèle annotée et une version lisible .

Le vocabulaire personnalisé doit être traité comme une ressource de configuration. Gemini 3.5 Transcribe accepte jusqu’à 1 000 termes, acronymes ou noms propres, mais Google indique que les meilleurs résultats sont généralement obtenus avec environ 100 termes ciblés . En pratique, cela signifie maintenir des listes par client, métier ou scénario: noms de médicaments pour la santé, références SKU pour le support, tickers pour la finance ou noms de projets internes pour les réunions.

Construire l’expérience en direct

La transcription en direct est une architecture différente. Le guide Live API indique que les développeurs peuvent se connecter via WebSockets ou le SDK Google Gen AI, diffuser l’audio en continu et recevoir des transcriptions textuelles incrémentales au fil de la parole . Le mode Live Transcription dédié utilise response_modalities=["TEXT"], se distingue d’un agent conversationnel en direct et traite le flux entrant comme de l’audio PCM brut 16 bits .

Cette différence est essentielle. Un agent en direct écoute, raisonne et peut répondre oralement; Live Transcription est une chaîne parole-texte à faible latence qui émet du texte en streaming . Pour des sous-titres, de la dictée, une prévisualisation de modération ou une superposition pendant une réunion, Live Transcription est généralement le bon choix. Pour un assistant vocal qui appelle des outils et répond en audio, il faut plutôt utiliser le modèle d’agent live plus large.

L’API Live expose des résultats provisoires et définitifs. Google documente server_content.interim_input_transcription pour les hypothèses partielles pendant que l’utilisateur parle, et server_content.input_transcription pour la transcription finalisée à la fin d’un tour de parole . Une bonne interface doit les afficher différemment: le texte provisoire peut rester visuellement léger, tandis que le texte définitif peut être inscrit dans la transcription, indexé ou envoyé à d’autres modèles.

Le mode Live prend aussi en charge la détection automatique de langue, le vocabulaire personnalisé et la transcription smart . Il ne prend pas en charge la diarisation, et les horodatages au mot ne sont pas disponibles dans les sessions Live API . D’où une architecture hybride fréquente: utiliser Live API pour l’expérience immédiate, puis retraiter l’audio enregistré avec l’endpoint fichier lorsque des locuteurs, des timestamps précis ou une preuve d’audit sont nécessaires.

Précision, langues et formatage

Google cite des mesures d’Artificial Analysis: 4,0 % de taux d’erreur mots moyen en streaming et 2,6 % hors streaming, ainsi qu’une amélioration de 70 % du temps jusqu’à la transcription finale par rapport à Chirp 3 . Sur le benchmark FLEURS, pour un ensemble de langues et variantes majeures, Google rapporte 5,50 % de WER en streaming et 5,04 % hors streaming . Ces chiffres sont utiles pour présélectionner la technologie, mais une équipe sérieuse doit tester ses propres audios, car micros, accents, chevauchements de parole et vocabulaire métier dominent souvent les résultats réels.

La couverture linguistique est large. La page du modèle indique que Gemini 3.5 Transcribe détecte automatiquement plus de 85 langues, gère le code-switching et prend en charge des codes BCP-47 comme en-US, fr-FR, de-DE, es-US, pt-BR, ja-JP et beaucoup d’autres . Le guide de transcription précise qu’omettre language_codes ou passer un tableau vide active la détection automatique, tandis que des indications de langue connues peuvent améliorer la précision .

Le formatage intelligent est l’une des fonctions les plus visibles côté produit. Google explique que le modèle peut supprimer les mots de remplissage, gérer les autocorrections et appliquer un formatage structuré, tandis que le guide développeur mentionne la normalisation inverse du texte, par exemple la conversion d’une devise énoncée oralement en forme écrite compacte . C’est utile pour les formulaires, les notes et les commandes vocales, mais les produits sensibles devraient toujours offrir un accès à la version brute lorsque les mots exacts comptent.

Prix et plan d’adoption

La page tarifaire de Google liste gemini-3.5-transcribe à 2,00 dollars par million de tokens d’entrée, soit une estimation de 0,003 dollar par minute audio, et 12,00 dollars par million de tokens de sortie, soit 0,002 dollar par minute de texte, pour un coût mixte estimé à environ 0,005 dollar par minute . Le modèle live est plus cher: gemini-3.5-transcribe-live est affiché à 3,50 dollars par million de tokens d’entrée, soit 0,005 dollar par minute audio, et 21,00 dollars par million de tokens de sortie, soit 0,004 dollar par minute de texte, pour un coût mixte estimé à environ 0,009 dollar par minute .

Le bon plan de construction est progressif. Il faut d’abord évaluer l’endpoint enregistré sur des échantillons réels, en comparant verbatim, smart, vocabulaire et diarisation. Il faut ensuite prototyper le streaming Live API uniquement lorsque la latence transforme l’expérience utilisateur. Enfin, il faut définir la conservation, le consentement et la revue humaine avant d’envoyer les transcriptions dans un moteur de recherche, un CRM ou des agents. Gemini 3.5 Transcribe apporte une couche vocale plus cohérente; les meilleurs produits seront ceux qui choisiront la bonne transcription pour chaque usage.

Commentaires

Sois le premier à commenter.

Sources des dernières 72 heures

  1. [1]Intelligent transcription with Gemini 3.5 Transcribe26 août 2026, 00:00 UTC
  2. [2]Gemini 3.5 Transcribe | Gemini API | Google AI for Developers26 août 2026, 00:00 UTC
  3. [3]Audio transcription | Gemini API | Google AI for Developers26 août 2026, 00:00 UTC
  4. [4]Live transcription with Gemini Live API | Gemini API | Google AI for Developers26 août 2026, 00:00 UTC
  5. [5]Gemini Developer API pricing | Gemini API | Google AI for Developers26 août 2026, 00:00 UTC
  6. [6]Gemini 3.5 Transcribe | Gemini Enterprise Agent Platform | Google Cloud Documentation26 août 2026, 00:00 UTC

Article généré par IA à partir d’une recherche web récente, puis conservé comme instantané éditorial daté.