
Tech • IA • Crypto
Les modèles Gemma 4 de Google et l’application AI Edge Gallery mettent en évidence des progrès rapides de l’IA embarquée, permettant des capacités puissantes, hors ligne et multimodales directement sur les smartphones.
Google a lancé Gemma 4 début avril avec quatre tailles de modèles: 2B et 4B optimisés pour les smartphones, et 26B et 31B pour les ordinateurs de bureau et les serveurs. Les modèles sont conçus pour offrir de solides performances sur diverses tâches, notamment le raisonnement et l’appel de fonctions, et ont rapidement gagné en popularité auprès des développeurs et des utilisateurs expérimentant des applications de type agent.
L’application AI Edge Gallery présente Gemma 4 fonctionnant entièrement en local, sans connexion Internet. Disponible sur App Store et Play Store, elle permet aux utilisateurs d’interagir avec une IA avancée localement, éliminant les préoccupations liées à la latence, au coût ou aux limites de tokens. L’application a dépassé les 5 millions de téléchargements en un mois, signe d’un fort intérêt.
L’exécution directe sur smartphone permet des usages sans connectivité, comme en avion ou en voyage isolé. Les utilisateurs peuvent effectuer instantanément des tâches comme des explications, traductions et requêtes générales, illustrant une évolution vers des expériences d’IA plus accessibles et indépendantes du cloud.
Des gains d’efficacité significatifs ont été démontrés, le modèle 2B égalant les performances d’un modèle dense 27B de l’année précédente. Cela indique des progrès rapides en compression et optimisation, suggérant que des IA toujours plus puissantes continueront de migrer vers les appareils en périphérie.
L’application introduit des compétences d’agent, permettant aux modèles d’interagir avec des outils comme web fetch ou des sources de données externes. Cela étend leurs capacités au-delà des données d’entraînement, permettant par exemple de résumer des pages web ou récupérer des informations à jour via des instructions en langage naturel.
L’intégration avec MCP (Model Context Protocol) étend la connexion aux outils, jeux de données et services externes. Les utilisateurs peuvent relier le modèle à des ressources comme des sites ou applications, permettant des interactions dynamiques comme résumer du contenu en ligne ou contrôler des systèmes via des commandes conversationnelles.
Gemma 4 prend en charge des entrées multimodales, incluant texte, images et audio. Cas d’usage: traduire des menus à partir de photos, extraire des données structurées d’images, générer des sorties formatées comme JSON ou listes. Le modèle peut aussi produire des résultats interactifs comme des interfaces simples ou mini-jeux.
Grâce à l’intégration d’outils, Gemma 4 peut servir d’interface en langage naturel pour les jeux et applications, permettant des commandes comme déplacer des personnages ou vérifier un inventaire. Cela positionne l’IA comme une couche conversationnelle pour interagir avec les logiciels.
Des fonctionnalités à venir incluent un historique de chat persistant, permettant de reprendre des conversations entre sessions. Couplé à une vitesse élevée — dépassant 3 000 tokens par seconde sur des GPU modernes — cela permet des interactions quasi instantanées et une continuité dans les workflows.
AI Edge Gallery est entièrement open source sur GitHub, permettant aux développeurs d’étudier, modifier et étendre ses fonctionnalités. Les utilisateurs peuvent créer et partager des compétences d’agent personnalisées, contribuant à un écosystème en expansion, incluant des solutions linguistiques locales et des outils spécialisés.
La combinaison de Gemma 4 et d’AI Edge Gallery montre que les gains d’efficacité et l’intégration rapide amènent une IA puissante directement sur les appareils personnels, transformant l’interaction avec la technologie sans dépendre du cloud.