8news

Tech • IA • Robotique

VIDÉO
ENFR
Aujourd'huiShortsÀ la uneVotre topicPour vousTopicsToutes les vidéosChaînes YTArchivesRechercheFavoris

Passer à l’échelle l’IA avec la pile logicielle TPU de Google

9/10
GoogleGoogle for Developers21 mai 2026 à 23:5137:52
Lecteur audio
0:00 / 0:00

INTRO

Google étend son infrastructure IA avec des TPU spécialisés et une pile logicielle complète visant à rendre l’entraînement, le fine-tuning et l’inférence des grands modèles plus efficaces et accessibles.

POINTS CLÉS

Évolution vers du matériel IA spécialisé

Google s’éloigne des systèmes généralistes au profit de puces adaptées à différents workloads IA. La famille TPU v8 sépare entraînement et inférence: TPU 8t vise un entraînement à haut débit à grande échelle, tandis que TPU 8i est optimisé pour une inférence à faible latence et à coût réduit. Cela reflète une tendance où l’inférence — surtout pour les modèles « réfléchissants » consommant beaucoup de tokens — devient une source majeure de demande de calcul.

L’inférence devient centrale dans l’intelligence des modèles

Les progrès des modèles de raisonnement déplacent davantage de complexité vers l’inférence plutôt que l’entraînement. Ces systèmes produisent des chaînes de raisonnement plus longues, ce qui renforce l’importance d’une exécution efficace. L’optimisation de la mémoire, de l’ordonnancement et de l’utilisation du matériel est désormais aussi critique que la conception du modèle.

vLLM améliore l’efficacité du serving

Le moteur d’inférence vLLM traite des goulets d’étranglement comme la fragmentation mémoire et les requêtes irrégulières. Son système PagedAttention virtualise le cache KV en blocs fixes pour améliorer l’utilisation, tandis que le batching continu planifie dynamiquement les charges au niveau des tokens. Des fonctions comme le cache de préfixe améliorent les performances dans les applications conversationnelles et agentiques en réutilisant des calculs partagés.

Portabilité multiplateforme pour les développeurs

vLLM offre un backend unifié compatible JAX et PyTorch, et fonctionne sur TPU et GPU sans modification du code applicatif. Cette portabilité permet de changer d’environnement matériel sans réécrire les couches de serving, réduisant la complexité opérationnelle.

Démonstration du serving de modèles à grande échelle

Un modèle Gemma 4 de 31 milliards de paramètres a été déployé sur 8 puces TPU, atteignant une utilisation mémoire quasi maximale. La configuration montre l’exécution parallèle, la gestion asynchrone des requêtes et des outils de profiling pour l’optimisation, illustrant un serving efficace en conditions proches de la production.

Le décodage spéculatif accélère l’inférence

Une implémentation de décodage spéculatif de type diffusion accélère fortement l’inférence. Un petit modèle prédit plusieurs tokens en parallèle, puis un grand modèle les valide, offrant jusqu’à 3× de gain de vitesse par rapport au décodage autorégressif classique.

Tunix simplifie le post-entraînement et le RL

Le framework Tunix permet du fine-tuning léger et de l’apprentissage par renforcement sur TPU, même avec des ressources gratuites comme Kaggle ou Colab. Il prend en charge le supervised fine-tuning (SFT), le reinforcement learning et la distillation de connaissances, permettant à de petits modèles d’hériter de capacités de modèles plus grands.

Fine-tuning efficace avec des modèles plus petits

Un modèle de 4 milliards de paramètres a été affiné via RL pour accomplir des tâches multimodales proches de modèles plus grands. Après entraînement, il fonctionne sur une seule puce TPU au lieu de plusieurs, montrant des gains d’efficacité sans perte de fonctionnalité.

MaxText permet un pré-entraînement à l’échelle

MaxText propose des configurations open source prêtes pour la production afin d’entraîner de grands modèles sur des milliers de puces. Basé sur JAX et OpenXLA, il inclut des « recettes » optimisées pour Gemma, Mistral et DeepSeek, permettant de passer d’expériences locales à un entraînement distribué sans refonte.

JAX et OpenXLA alimentent la pile

L’écosystème repose fortement sur JAX, qui offre des transformations composables pour la différentiation, la compilation et le parallélisme. En dessous, OpenXLA gère l’optimisation bas niveau et l’exécution distribuée, coordonnant efficacement de grands clusters TPU.

TorchTPU étend la compatibilité PyTorch

Google développe TorchTPU, une pile PyTorch native pour TPU en collaboration avec Meta. L’objectif est d’exécuter des modèles PyTorch sur TPU avec peu ou pas de modifications, facilitant l’adoption pour les équipes habituées à CUDA.

Kinetic réduit la complexité d’infrastructure

Le projet Kinetic simplifie le déploiement en automatisant la configuration des clusters TPU avec un minimum de paramètres, permettant aux développeurs de se concentrer sur le code plutôt que sur l’infrastructure.

CONCLUSION

La stratégie de Google combine matériel spécialisé et écosystème logiciel mature pour accélérer, optimiser et démocratiser le développement IA à grande échelle, en entraînement comme en inférence.

Explique-moi
Transcription complète

Sur le même sujet : Google