
Tech • IA • Robotique
Google étend son infrastructure IA avec des TPU spécialisés et une pile logicielle complète visant à rendre l’entraînement, le fine-tuning et l’inférence des grands modèles plus efficaces et accessibles.
Google s’éloigne des systèmes généralistes au profit de puces adaptées à différents workloads IA. La famille TPU v8 sépare entraînement et inférence: TPU 8t vise un entraînement à haut débit à grande échelle, tandis que TPU 8i est optimisé pour une inférence à faible latence et à coût réduit. Cela reflète une tendance où l’inférence — surtout pour les modèles « réfléchissants » consommant beaucoup de tokens — devient une source majeure de demande de calcul.
Les progrès des modèles de raisonnement déplacent davantage de complexité vers l’inférence plutôt que l’entraînement. Ces systèmes produisent des chaînes de raisonnement plus longues, ce qui renforce l’importance d’une exécution efficace. L’optimisation de la mémoire, de l’ordonnancement et de l’utilisation du matériel est désormais aussi critique que la conception du modèle.
Le moteur d’inférence vLLM traite des goulets d’étranglement comme la fragmentation mémoire et les requêtes irrégulières. Son système PagedAttention virtualise le cache KV en blocs fixes pour améliorer l’utilisation, tandis que le batching continu planifie dynamiquement les charges au niveau des tokens. Des fonctions comme le cache de préfixe améliorent les performances dans les applications conversationnelles et agentiques en réutilisant des calculs partagés.
vLLM offre un backend unifié compatible JAX et PyTorch, et fonctionne sur TPU et GPU sans modification du code applicatif. Cette portabilité permet de changer d’environnement matériel sans réécrire les couches de serving, réduisant la complexité opérationnelle.
Un modèle Gemma 4 de 31 milliards de paramètres a été déployé sur 8 puces TPU, atteignant une utilisation mémoire quasi maximale. La configuration montre l’exécution parallèle, la gestion asynchrone des requêtes et des outils de profiling pour l’optimisation, illustrant un serving efficace en conditions proches de la production.
Une implémentation de décodage spéculatif de type diffusion accélère fortement l’inférence. Un petit modèle prédit plusieurs tokens en parallèle, puis un grand modèle les valide, offrant jusqu’à 3× de gain de vitesse par rapport au décodage autorégressif classique.
Le framework Tunix permet du fine-tuning léger et de l’apprentissage par renforcement sur TPU, même avec des ressources gratuites comme Kaggle ou Colab. Il prend en charge le supervised fine-tuning (SFT), le reinforcement learning et la distillation de connaissances, permettant à de petits modèles d’hériter de capacités de modèles plus grands.
Un modèle de 4 milliards de paramètres a été affiné via RL pour accomplir des tâches multimodales proches de modèles plus grands. Après entraînement, il fonctionne sur une seule puce TPU au lieu de plusieurs, montrant des gains d’efficacité sans perte de fonctionnalité.
MaxText propose des configurations open source prêtes pour la production afin d’entraîner de grands modèles sur des milliers de puces. Basé sur JAX et OpenXLA, il inclut des « recettes » optimisées pour Gemma, Mistral et DeepSeek, permettant de passer d’expériences locales à un entraînement distribué sans refonte.
L’écosystème repose fortement sur JAX, qui offre des transformations composables pour la différentiation, la compilation et le parallélisme. En dessous, OpenXLA gère l’optimisation bas niveau et l’exécution distribuée, coordonnant efficacement de grands clusters TPU.
Google développe TorchTPU, une pile PyTorch native pour TPU en collaboration avec Meta. L’objectif est d’exécuter des modèles PyTorch sur TPU avec peu ou pas de modifications, facilitant l’adoption pour les équipes habituées à CUDA.
Le projet Kinetic simplifie le déploiement en automatisant la configuration des clusters TPU avec un minimum de paramètres, permettant aux développeurs de se concentrer sur le code plutôt que sur l’infrastructure.
La stratégie de Google combine matériel spécialisé et écosystème logiciel mature pour accélérer, optimiser et démocratiser le développement IA à grande échelle, en entraînement comme en inférence.
Explique-moi