8news

Tech • IA • Robotique

VIDÉO
ENFR
Aujourd'huiShortsÀ la uneVotre topicPour vousTopicsToutes les vidéosChaînes YTArchivesRechercheFavoris

Prise en main de Gemini 3.7 Flash

7/10
GoogleGoogle for Developers17 août 2026 à 18:404:21
Lecteur audio
0:00 / 0:00

INTRO

Les entreprises choisissent de plus en plus des modèles d’IA moins chers et plus rapides pour les workflows à fort volume, en les utilisant aux côtés de systèmes haut de gamme afin de réduire les coûts, la latence et de faire passer à l’échelle l’automatisation multi-agents.

POINTS CLÉS

Le coût devient un critère d’achat central

Les entreprises qui déploient l’IA à grande échelle considèrent de plus en plus le choix du modèle comme une décision économique autant que technique. L’attention se déplace de l’usage systématique du modèle le plus avancé disponible vers la recherche d’un modèle minimum viable offrant une précision fiable au coût le plus bas possible et avec les temps de réponse les plus rapides. Des prix par token plus faibles peuvent libérer du budget pour des produits supplémentaires, des expérimentations et de l’automatisation.

Les tâches d’entreprise à fort volume favorisent les modèles efficaces

Dans des secteurs comme l’assurance et les services financiers, les entreprises traitent des milliers et des milliers de documents dans des workflows récurrents. Beaucoup de tâches individuelles dans ces chaînes ne sont pas particulièrement complexes, mais l’échelle opérationnelle rend l’efficacité essentielle. Pour des plateformes de contenu et de workflow comme Box, un modèle doit être assez capable pour faire fonctionner ces agents, tout en étant suffisamment peu coûteux et rapide pour supporter un débit de niveau entreprise.

Les décisions fondées sur les données ont besoin d’une automatisation abordable

Des plateformes de données d’entreprise comme Databricks constatent une demande pour des systèmes d’IA aidant les organisations à prendre un grand nombre de décisions quotidiennes fondées sur les données. Historiquement, cela exigeait des analystes experts rares pour trouver les bonnes informations et les interpréter. Les modèles efficaces deviennent un moyen d’élargir l’accès à l’analyse tout en gardant les dépenses sous contrôle, surtout lorsque les entreprises veulent des résultats de niveau frontier sans les coûts d’exploitation de niveau frontier.

Une inférence moins chère élargit ce que les développeurs peuvent construire

Les développeurs affirment que de fortes réductions du coût des tâches peuvent modifier concrètement les feuilles de route produit. Si un agent peut effectuer le même travail à un coût 10x inférieur, les équipes peuvent cesser de rationner l’usage des tokens et appliquer l’IA à davantage de fonctionnalités et de processus internes. Cela ouvre la voie à des expérimentations plus larges et rend financièrement viables des cas d’usage auparavant marginaux.

La latence compte autant que le prix

Des coûts par token plus bas ne sont qu’une partie de l’équation. Une meilleure latence permet d’insérer des modèles efficaces dans davantage d’étapes d’une pile applicative, en particulier là où un routage ou une classification rapides sont nécessaires. Un modèle simplement précis ne suffit plus; les entreprises en veulent un qui soit constamment fiable, peu coûteux et rapide.

Les systèmes multi-agents stimulent la demande

Les déploiements d’IA dépassent de plus en plus les conceptions à agent unique. Un schéma courant consiste à utiliser un agent principal pour planifier une tâche, identifier les données nécessaires, puis envoyer des sous-agents explorer en parallèle différentes parties du problème. Dans ces architectures, les modèles à faible latence sont précieux, car ils peuvent gérer un travail d’orchestration répété sans créer de goulets d’étranglement de coût ou de vitesse.

Des stratégies de modèles par niveaux émergent

Plutôt que de s’appuyer sur un seul modèle pour tout faire, les entreprises combinent différents niveaux de modèles dans un même workflow. Un système plus petit et plus rapide peut d’abord effectuer une classification d’intention pour déterminer ce que demande un prompt, une étape qui doit se produire rapidement avant même le début de la planification. Des modèles plus avancés peuvent ensuite être utilisés uniquement là où un raisonnement plus profond est nécessaire, ce qui permet aux entreprises de réserver l’inférence premium aux parties du workflow qui le justifient.

Les schémas d’agents récursifs accentuent la pression sur l’efficacité

Certains systèmes permettent désormais aux agents de créer récursivement des sous-agents à mesure que les tâches deviennent plus complexes. Cette conception peut améliorer la flexibilité et le parallélisme, mais elle multiplie aussi le nombre d’appels au modèle. Par conséquent, l’économie de chaque étape d’inférence devient plus importante, ce qui renforce l’intérêt des modèles efficaces dans les couches de planification, de routage et de coordination.

CONCLUSION

L’adoption de l’IA en entreprise évolue vers une orchestration pragmatique des modèles, où le coût, la vitesse et la fiabilité déterminent autant les choix de déploiement que les capacités brutes. Il en résulte une tendance plus large à utiliser des modèles moins chers pour le travail répétitif à fort volume et à réserver les systèmes frontier aux tâches qui les exigent réellement.

Explique-moi
Transcription complète

Sur le même sujet : Google