
Tech • IA • Robotique
Google a lancé son premier modèle de transcription basé sur Gemini, offrant la conversion de la parole en texte en mode batch et en direct, avec une meilleure précision pour des éléments comme les adresses e-mail, les numéros de téléphone, les langues mixtes et les unités de mesure.
Le nouveau modèle Gemini 3.5 Transcribe est disponible pour la transcription standard via l’Interactions API et pour l’usage en temps réel via la Live API. Cette sortie vise les applications qui ont besoin d’une reconnaissance vocale à faible latence ainsi que de transcriptions finales post-traitées.
Contrairement aux systèmes classiques de conversion parole-texte, le modèle est conçu comme un système de transcription basée sur un LLM. Cette approche vise à mieux reconnaître les contenus oraux difficiles comme les chaînes alphanumériques, les noms et les adresses e-mail, qui provoquent souvent des erreurs dans les pipelines de transcription standard.
La précision peut être améliorée en fournissant un vocabulaire personnalisé, comme les noms des personnes attendues dans une réunion. Lors d’une démonstration, un prénom non standard a été correctement reconnu après avoir été fourni comme contexte préalable, montrant comment des indices propres au domaine peuvent réduire les erreurs d’interprétation.
Une fonctionnalité notable est la capacité du modèle à réviser une sortie antérieure dans la transcription finale. Lorsqu’une adresse e-mail a d’abord été captée de manière incorrecte, le système l’a corrigée plus tard après avoir traité davantage de contexte, produisant un résultat final plus précis que le premier passage en direct.
Le modèle a montré qu’il pouvait reconnaître des coordonnées énoncées à l’oral et les formater correctement, y compris les adresses e-mail et les numéros de téléphone. Il a identifié un numéro de téléphone américain au format attendu et a aussi traité un numéro de Singapour, reflétant la prise en charge de conventions régionales plutôt qu’une simple capture de chiffres.
Les utilisateurs peuvent définir des indications de langue attendues pour améliorer la qualité de transcription, mais le modèle peut tout de même reconnaître automatiquement la parole dans plus de 70 langues. Même configuré pour l’anglais, il restait capable de détecter et de transcrire des mots en allemand, ce qui indique une prise en charge des conversations multilingues et du changement de langue au sein d’un même échange.
Le système vise aussi à interpréter plus précisément les mesures énoncées et le contexte lié aux nombres, y compris des unités comme les mètres et les centimètres. Il est conçu pour réduire l’ambiguïté dans les cas où les différences de langue peuvent affecter le sens des grands nombres et des termes de mesure.
Ce lancement positionne Gemini 3.5 Transcribe comme une alternative aux systèmes traditionnels de reconnaissance vocale davantage sensible au contexte, en particulier pour la transcription en direct où l’exactitude des noms, des nombres et de la parole multilingue compte le plus.
Explique-moi