8news

Tech • IA • Robotique

VIDÉO
ENFR
Aujourd'huiShortsÀ la uneVotre topicPour vousTopicsToutes les vidéosChaînes YTArchivesRechercheFavoris

Créer des agents avec l’API Gemini

8/10
GoogleGoogle for Developers21 mai 2026 à 23:5238:13
Lecteur audio
0:00 / 0:00

INTRO

Google a dévoilé de nouvelles API Gemini permettant des agents multimodaux en temps réel, une interaction unifiée avec les modèles et des environnements sandbox gérés pour créer des applications autonomes.

POINTS CLÉS

Gemini 3.1 Flash Live alimente des agents multimodaux en temps réel

Le modèle Gemini 3.1 Flash Live introduit des interactions en temps réel à faible latence via la voix, le texte, les images et la vidéo. Il fonctionne grâce à une connexion WebSocket avec état, permettant un flux continu d’entrées et de sorties. Le système prend en charge des interactions vocales dans plus de 90 langues, facilitant les conversations multilingues fluides et la gestion des interruptions en direct.

Capacités multimodales de bout en bout

La force de Gemini réside dans sa capacité à traiter et générer plusieurs formats. Il peut interpréter des scènes visuelles, du texte écrit et de l’audio simultanément, tout en produisant des sorties comme de la parole, des images et de la vidéo. Des démonstrations ont inclus la génération musicale à la demande avec Lyria 3, illustrant l’intégration entre agents conversationnels et outils de génération de médias.

Appels de fonctions et intégration d’outils

La plateforme permet aux agents d’exécuter des actions via l’utilisation d’outils et des appels de fonctions, incluant des intégrations natives comme le grounding Google Search et des API personnalisées. Cela permet de récupérer des données en temps réel ou de déclencher des services externes, au-delà de réponses statiques.

Accès direct côté client avec des tokens éphémères

Les développeurs peuvent se connecter directement à l’API Live depuis des applications clientes via des tokens éphémères de courte durée, réduisant la complexité backend. Cette approche permet des applications réactives comme la manipulation d’UI, l’assistance au code en direct et le débogage interactif avec retour immédiat.

Introduction de l’API unifiée Interactions

La nouvelle API Interactions standardise la manière dont les développeurs interagissent avec les modèles et les agents. Une structure d’appel unique couvre des tâches allant de requêtes simples à des workflows complexes. Elle inclut une gestion d’état côté serveur, évitant de maintenir manuellement l’historique des conversations.

Un modèle basé sur des étapes remplace les tours de chat

Les formats traditionnels sont remplacés par un modèle d’interaction par étapes, où chaque action—entrée utilisateur, raisonnement, appel d’outil ou résultat—est suivie indépendamment. Cette structure reflète mieux le fonctionnement des agents et simplifie l’orchestration de प्रक्रus multi-étapes.

Agents gérés avec environnements d’exécution distants

Google a introduit des agents gérés comme Antigravity, s’exécutant dans des environnements cloud isolés capables d’exécuter du code, d’accéder à des fichiers et d’agir de manière autonome. Chaque agent opère dans son propre sandbox, comme une machine virtuelle dédiée.

Environnements persistants et contexte partagé

Ces environnements sont persistants et réutilisables, permettant de conserver l’état entre sessions. Plusieurs agents peuvent partager un même environnement, facilitant des workflows où l’un recherche et l’autre construit à partir des données générées.

Gestion sécurisée des identifiants via un système proxy

Un mécanisme proxy garantit que les identifiants sensibles comme les clés API ne sont jamais exposés à l’agent, même lors de requêtes authentifiées. Le système intercepte les appels et injecte les identifiants de façon sécurisée.

Génération automatisée d’applications en un seul appel

Des démonstrations ont montré des agents produisant des résultats complets—comme un tableau météo ou un jeu navigateur—à partir d’une seule requête. L’agent gère la planification, le code, les tests et la génération de fichiers de manière autonome.

Outils développeur et création d’agents

De nouveaux outils comme un Gemini CLI et des “skills” préconstruits simplifient la création d’agents. Les développeurs peuvent définir des agents via des fichiers de configuration, ajouter des outils et préparer des environnements avec des dépendances comme Python. Les agents peuvent aussi configurer eux-mêmes leur environnement.

CONCLUSION

Les dernières avancées de Gemini marquent un tournant vers des agents multimodaux entièrement autonomes, capables de raisonner, agir et construire dans des environnements cloud sécurisés, réduisant fortement la complexité de création d’applications IA avancées.

Explique-moi
Transcription complète

Sur le même sujet : Google