
Tech • IA • Robotique
Google DeepMind a lancé Gemini Embedding 2, un modèle multimodal qui unifie texte, images, audio, vidéo et documents dans un espace d’embedding unique pour la recherche et les workflows d’IA.
Gemini Embedding 2 mappe directement plusieurs types de données — texte, images, audio, vidéo et documents — dans un espace vectoriel partagé. Cela permet aux systèmes de comparer et de récupérer des informations entre formats sans tout convertir en texte, améliorant à la fois la précision et l’efficacité.
Le modèle permet de combiner différentes modalités dans une seule requête, par exemple associer une image à du texte descriptif ou de l’audio. Ces entrées sont fusionnées en un embedding composite, ce qui simplifie la conception des systèmes et réduit le besoin de pipelines de traitement séparés.
Le modèle gère plus de 100 langues nativement. Cela permet de créer des applications globales sans couches de traduction supplémentaires, tout en maintenant une cohérence sémantique entre langues et types de médias.
Grâce à l’apprentissage de représentations Matryoshka, le modèle privilégie les informations sémantiques clés dans les premières dimensions du vecteur. Les développeurs peuvent choisir la taille par défaut de 3 072 dimensions ou des tailles plus petites comme 1 536 ou 768, en équilibrant performance, coût de stockage et latence de recherche tout en préservant la qualité.
Le système établit de nouveaux standards sur des tâches multimodales, surpassant les modèles de référence en texte, image et vidéo, tout en ajoutant la compréhension de la parole. Il constitue ainsi une base solide pour des systèmes avancés de recherche en IA.
Le modèle est conçu comme socle pour la génération augmentée par récupération multimodale (RAG) et les systèmes à base d’agents. Il permet d’interroger des sources de données mixtes — bibliothèques vidéo, enregistrements de réunions, documents — au sein d’un cadre unifié.
Gemini Embedding 2 est optimisé pour plusieurs applications, dont la recherche sémantique, la réponse aux questions, la classification, le clustering, la recherche de code et la vérification des faits. Des recommandations de prompting spécifiques sont fournies pour améliorer les performances dans chaque cas.
Les développeurs peuvent effectuer des recherches de similarité entre modalités, comme retrouver des images à partir de requêtes textuelles ou associer des extraits audio à du contenu visuel. Par exemple, une requête comme « animal » peut renvoyer des images pertinentes, tandis qu’une image peut retrouver des éléments similaires visuellement ou sémantiquement.
Le modèle est disponible via l’API Gemini et la Gemini Enterprise Agent Platform. L’implémentation nécessite peu de code, avec prise en charge de l’embedding direct de fichiers bruts comme des images, de l’audio et des PDF via des SDK standard.
Gemini Embedding 2 marque une avancée importante vers des systèmes d’IA multimodaux unifiés, en facilitant la recherche, la récupération et les workflows d’agents sur des données variées.
Explique-moi