
Tech • IA • Crypto
OpenAI a dévoilé un nouveau système de voix ChatGPT propulsé par GPT Live 1, permettant une conversation en temps réel en duplex intégral, avec raisonnement, accès web et traduction en direct.
Le nouveau modèle vocal fonctionne en duplex intégral, permettant aux utilisateurs et à l’IA de parler et d’écouter simultanément, imitant un dialogue humain naturel. Il gère les interruptions, les pauses et les corrections en cours de phrase sans casser le flux de la conversation. Cela marque un passage des assistants à tours de parole vers une interaction fluide et superposée.
Le système s’adapte aux indices conversationnels, décidant quand répondre, attendre ou céder la parole. Il prend en charge la réflexion à voix haute et les retours en arrière dans la discussion, créant un échange plus réaliste. Cela réduit les frictions dans les interfaces vocales, surtout dans des contextes rapides ou informels.
Au-delà de la conversation, le modèle peut raisonner sur des tâches complexes en temps réel. Les démonstrations incluaient la vérification de faits historiques, l’identification de dates incorrectes et des réponses précises sous contrainte de temps. Cela reflète des progrès plus larges du raisonnement multimodal en contexte vocal.
L’assistant vocal peut rechercher sur le web pendant la conversation afin de fournir des informations actuelles. Des exemples incluaient la vérification des conditions de transport à la station 16th Street Mission BART de San Francisco et l’obtention de la météo en temps réel. Cela permet des usages pratiques au-delà des connaissances statiques.
Une fonctionnalité intégrée de traduction en direct permet une communication fluide entre langues. Dans un scénario de négociation simulé, le système traduisait entre l’anglais et le français en temps réel tout en conservant le ton et l’intention, montrant son potentiel pour les voyages et le commerce.
Le modèle intègre plusieurs tâches au sein d’un même dialogue, comme la vérification de faits, la planification et les recommandations. Il peut changer rapidement de contexte sans perdre en cohérence, prenant en charge des usages comme l’organisation de voyages, la planification et la prise de décision.
Le système est conçu pour « savoir quand intervenir ou se retirer », en équilibrant réactivité et retenue. Cela réduit les interruptions et évite de trop parler, un problème fréquent des anciens assistants vocaux.
Les démonstrations incluaient la planification d’un voyage à Santorin, la préparation d’un cours sur l’histoire du son et des suggestions de restaurants. Ces exemples soulignent son utilité dans l’éducation, les voyages et la vie quotidienne.
Le nouveau système de voix ChatGPT marque une évolution vers des assistants vocaux plus naturels, intelligents et contextuels, combinant dialogue en temps réel, raisonnement et accès à des données actualisées dans une seule interface conversationnelle.