8news

Tech • IA • Robotique

VIDÉO
ENFR
Aujourd'huiShortsÀ la uneVotre topicPour vousTopicsToutes les vidéosChaînes YTArchivesRechercheFavoris

La nouvelle puce IA d’OpenAI devient réalité (bat NVIDIA)

9.3/10
IAAI Revolution28 août 2026 à 01:5315:56
Lecteur audio
0:00 / 0:00

INTRO

OpenAI affirme que sa nouvelle puce d’inférence Jalapeno surpasse les accélérateurs de classe Nvidia GB300 sur des tests publics d’efficacité et de latence, tandis que de nouvelles rumeurs de déploiement chez Anthropic et la sortie moins coûteuse de Qwen par Alibaba montrent à quelle vitesse le marché de l’inférence IA évolue.

POINTS CLÉS

OpenAI publie des résultats d’efficacité remarqués

OpenAI a publié des résultats de benchmark pour Jalapeno, un ASIC personnalisé conçu avec Broadcom pour l’inférence plutôt que l’entraînement. Dans un benchmark public InferenceX, l’entreprise affirme que la puce a fourni entre 1.5x et 1.9x plus de travail IA par watt que les meilleurs résultats enregistrés pour Nvidia GB200/GB300 à débit maximal, tout en réduisant la latence de bout en bout.

Le chiffre de 104x s’accompagne d’une réserve majeure

Le résultat le plus frappant provenait d’un test alignant Jalapeno sur la vitesse de décodage la plus rapide du système rival, puis comparant le débit par kilowatt. Dans ce cadre, Jalapeno a atteint 104.3x le débit par kilowatt sur DeepSeek R1, ainsi que 53.7x sur GPT OSS 120B et 56.1x sur Kimi K2.5. Cela ne signifie pas que la puce est 100 fois plus rapide au total; cela reflète la forte chute d’efficacité du système rival lorsqu’il est poussé à des vitesses extrêmes de décodage interactif.

La normalisation par la puissance est centrale dans la comparaison

OpenAI a normalisé les résultats selon la puissance, et non selon le nombre de puces. Jalapeno est donnée pour 700 watts, contre 1,200 watts pour GB200 et 1,400 watts pour GB300, et la puissance mesurée soutenue aurait été de 550 watts ou moins sur les charges testées. L’entreprise soutient que la performance par kilowatt est la métrique la plus pertinente pour le déploiement en centre de données, mais ce choix influe aussi fortement sur les ratios finaux.

La latence a progressé en même temps que le débit

Sur des charges très interactives, Jalapeno a offert entre 1.7x et 3.6x plus de performances avec une latence de bout en bout environ six fois plus faible. La latence totale par requête sur GPT OSS était de 1.03 seconde contre 1.80, sur DeepSeek R1 de 1.65 contre 5.99, et sur Kimi K2.5 de 1.56 contre 5.31. La vitesse brute de décodage par utilisateur était aussi bien plus élevée, atteignant 1,459 tokens par seconde sur GPT OSS.

Le benchmark a utilisé des modèles à poids publics

Les tests ont été menés sur GPT OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T plutôt que sur des systèmes propriétaires de pointe. Ce choix rend la configuration plus reproductible et évite de demander au marché de faire confiance à un comportement de modèle non visible. OpenAI indique que des tests internes sur ses propres modèles de pointe montraient un avantage encore plus large, sans publier ces chiffres.

La conception vise directement les goulets d’étranglement de l’inférence

La puce est conçue autour de la nature scindée de l’inférence des grands modèles: le prefill est limité par le calcul, tandis que le decode est limité par la bande passante mémoire et les surcoûts de communication. OpenAI affirme que Jalapeno conserve l’état du modèle et le KV cache localement lorsque c’est possible et traite le réseau comme une partie de l’architecture, ce qui lui permet de passer plus fluidement entre des charges dominées par le prefill ou par le decode.

L’IA a aidé à concevoir et optimiser la puce

OpenAI explique que des modèles ont été utilisés pour explorer des implémentations, raccourcir les boucles de vérification et optimiser les circuits arithmétiques, aidant à passer de la conception initiale au tape-out en neuf mois. En utilisant Codex avec GPT Astra, les ingénieurs auraient adapté trois modèles à poids ouverts à la puce en deux mois, et des kernels générés par IA pour certains blocs de GPT OSS se sont exécutés 1.5x à 1.8x plus vite que des versions écrites par des humains.

Le déploiement reste progressif

Un déploiement en petits volumes est prévu d’ici la fin de cette année, avec une montée en charge jusqu’en 2027. OpenAI a indiqué que la puce ne remplace pas Nvidia, et que sa stratégie globale de calcul continuera de s’appuyer sur des partenaires externes pour l’entraînement comme pour l’inférence.

Anthropic fait face à des rumeurs de déploiement et à des critiques produit

Deux noms de modèles temporaires, Melon et Marshmallow, sont apparus brièvement puis ont disparu, alimentant les spéculations selon lesquelles Fable 5.1 et peut-être Sonnet 5.1 seraient déployés discrètement. Des testeurs ont signalé un code front-end plus propre, un meilleur raisonnement sur de longues chaînes, un usage des outils plus solide et une meilleure rédaction juridique, mais aussi des refus plus stricts sur le droit d’auteur. En parallèle, Opus 5 a suscité des plaintes le décrivant comme têtu, paresseux et sujet à des boucles d’excuses après des erreurs; Anthropic a reconnu des problèmes de constance et a indiqué que corriger ce comportement était prioritaire.

Alibaba réduit le coût d’entraînement avec Qwen 3.8 Flash

Alibaba a lancé Qwen 3.8 Flash, un modèle multimodal présenté comme plus performant en code et en tâches bureautiques que Qwen 3.7 Plus pour un coût d’entraînement d’environ un neuvième. Il propose une fenêtre de contexte par défaut de 262,144 tokens, extensible à 1 million, avec un tarif de 1 yuan par million de tokens d’entrée et 3 yuan par million de tokens de sortie. L’entreprise a aussi publié en open source Qwen 3.8 Flash Next comme aperçu d’une architecture prévue pour la famille Qwen 4.

La mémoire de Claude fonctionne désormais entre les produits

Anthropic a fusionné la mémoire entre le chat et Claude Code, réduisant le besoin de réexpliquer le contexte lors du passage d’un projet d’un outil à l’autre. Les utilisateurs peuvent consulter, modifier et supprimer la mémoire stockée, tandis que des catégories sensibles comme la santé, la religion, la politique, la race et l’identité de genre restent exclues par défaut, sauf si les utilisateurs choisissent d’y consentir.

CONCLUSION

Les développements de la semaine indiquent un marché de plus en plus défini par l’efficacité de l’inférence, la baisse des coûts d’exploitation et une intégration produit plus étroite. Le point essentiel n’est pas un ratio de benchmark isolé, mais l’accélération de la concurrence pour contrôler la manière dont l’IA est fournie à grande échelle.

Explique-moi
Transcription complète

Sur le même sujet : IA