
Tech • IA • Robotique
Google a dévoilé de nouvelles API Gemini permettant des agents multimodaux en temps réel, une interaction unifiée avec les modèles et des environnements sandbox gérés pour créer des applications autonomes.
Le modèle Gemini 3.1 Flash Live introduit des interactions en temps réel à faible latence via la voix, le texte, les images et la vidéo. Il fonctionne grâce à une connexion WebSocket avec état, permettant un flux continu d’entrées et de sorties. Le système prend en charge des interactions vocales dans plus de 90 langues, facilitant les conversations multilingues fluides et la gestion des interruptions en direct.
La force de Gemini réside dans sa capacité à traiter et générer plusieurs formats. Il peut interpréter des scènes visuelles, du texte écrit et de l’audio simultanément, tout en produisant des sorties comme de la parole, des images et de la vidéo. Des démonstrations ont inclus la génération musicale à la demande avec Lyria 3, illustrant l’intégration entre agents conversationnels et outils de génération de médias.
La plateforme permet aux agents d’exécuter des actions via l’utilisation d’outils et des appels de fonctions, incluant des intégrations natives comme le grounding Google Search et des API personnalisées. Cela permet de récupérer des données en temps réel ou de déclencher des services externes, au-delà de réponses statiques.
Les développeurs peuvent se connecter directement à l’API Live depuis des applications clientes via des tokens éphémères de courte durée, réduisant la complexité backend. Cette approche permet des applications réactives comme la manipulation d’UI, l’assistance au code en direct et le débogage interactif avec retour immédiat.
La nouvelle API Interactions standardise la manière dont les développeurs interagissent avec les modèles et les agents. Une structure d’appel unique couvre des tâches allant de requêtes simples à des workflows complexes. Elle inclut une gestion d’état côté serveur, évitant de maintenir manuellement l’historique des conversations.
Les formats traditionnels sont remplacés par un modèle d’interaction par étapes, où chaque action—entrée utilisateur, raisonnement, appel d’outil ou résultat—est suivie indépendamment. Cette structure reflète mieux le fonctionnement des agents et simplifie l’orchestration de प्रक्रus multi-étapes.
Google a introduit des agents gérés comme Antigravity, s’exécutant dans des environnements cloud isolés capables d’exécuter du code, d’accéder à des fichiers et d’agir de manière autonome. Chaque agent opère dans son propre sandbox, comme une machine virtuelle dédiée.
Ces environnements sont persistants et réutilisables, permettant de conserver l’état entre sessions. Plusieurs agents peuvent partager un même environnement, facilitant des workflows où l’un recherche et l’autre construit à partir des données générées.
Un mécanisme proxy garantit que les identifiants sensibles comme les clés API ne sont jamais exposés à l’agent, même lors de requêtes authentifiées. Le système intercepte les appels et injecte les identifiants de façon sécurisée.
Des démonstrations ont montré des agents produisant des résultats complets—comme un tableau météo ou un jeu navigateur—à partir d’une seule requête. L’agent gère la planification, le code, les tests et la génération de fichiers de manière autonome.
De nouveaux outils comme un Gemini CLI et des “skills” préconstruits simplifient la création d’agents. Les développeurs peuvent définir des agents via des fichiers de configuration, ajouter des outils et préparer des environnements avec des dépendances comme Python. Les agents peuvent aussi configurer eux-mêmes leur environnement.
Les dernières avancées de Gemini marquent un tournant vers des agents multimodaux entièrement autonomes, capables de raisonner, agir et construire dans des environnements cloud sécurisés, réduisant fortement la complexité de création d’applications IA avancées.
Explique-moi