
Tech • IA • Crypto
Une vague rapide de sorties d’IA chinoises, menée par Qwen 3.8 Max d’Alibaba, signale une intensification de la concurrence mondiale portée par l’échelle, l’efficacité et un solide vivier de talents domestiques.
Alibaba a dévoilé Qwen 3.8 Max, un modèle multimodal de 2,4 billions de paramètres, parmi les plus grands au monde. Il se classe premier modèle texte chinois sur Arena AI et deuxième mondial sur les benchmarks visuels, juste derrière un système d’Anthropic. Le modèle gère texte, images et vidéo avec jusqu’à 1 million de tokens de contexte, permettant le traitement de documents et de code à grande échelle.
Malgré son ampleur, Qwen n’active que 95 milliards de paramètres par tâche via une architecture mixture-of-experts. Cela réduit le coût de calcul et la latence tout en maintenant de hautes performances. Le système aurait mené à bien un projet complet d’ingénierie logicielle en 16 jours, illustrant ses capacités appliquées.
Le 31 juillet, trois grands laboratoires chinois — MiniMax, ByteDance et DeepSeek — ont lancé simultanément de nouveaux systèmes. Ce regroupement souligne une concurrence domestique intense et des cycles d’itération rapides dans la génération vidéo et l’infrastructure IA.
H3 de MiniMax introduit un système vidéo multimodal unifié capable de génération, d’édition et de composition dans un seul pipeline. Il prend en charge une sortie 2K et jusqu’à 15 secondes de contenu audiovisuel par exécution, en intégrant texte, image, audio et vidéo. Le modèle domine les benchmarks d’édition vidéo et est tarifé à environ 0,8 yuan par seconde, nettement inférieur aux concurrents.
H3 permet un transfert de mouvement avancé, autorisant le remplacement de personnages, produits et environnements tout en conservant le mouvement d’origine. Cela simplifie la production publicitaire en transformant des ressources brutes — images produit, éléments de marque et clips de référence — en vidéos marketing finalisées avec peu d’édition manuelle.
Seedance 2.5 de ByteDance double la durée vidéo en un seul passage à 30 secondes et se concentre sur la cohérence narrative. Le modèle maintient personnages, scènes et style sur la durée, permettant des vidéos de plusieurs minutes via génération continue. Il accepte jusqu’à 30 images, 10 vidéos et 10 entrées audio pour un contrôle créatif détaillé.
Seedance 2.5 réduit les artefacts courants comme les personnages incohérents et les textures artificielles. Il permet une édition au niveau de la timeline, avec un contrôle précis des actions, angles de caméra et transitions de scènes, marquant le passage de clips isolés à des workflows de production complets.
DeepSeek V4 Flash met l’accent sur l’accessibilité plutôt que l’échelle, avec des gains via le post-entraînement plutôt que des modèles plus grands. Prix: 0,14 $ par million de tokens en entrée et 0,28 $ par million en sortie, avec un coût moyen par tâche de 0,03 $ — plus de 100 fois moins cher que des concurrents comme Claude Fable 5.
Sur un indice composite d’intelligence, V4 Flash obtient 50/100, équivalent à des modèles mondiaux intermédiaires tout en étant bien moins cher. Il est optimisé pour des tâches d’agents (code, outils, automatisation), reflétant un virage vers l’efficacité de déploiement.
Des recherches de Stanford HAI et de la Hoover Institution montrent que 84,5 % des chercheurs affiliés à DeepSeek sont basés en Chine, dont 53,5 % formés entièrement sur place. Parmi ceux ayant une expérience aux États-Unis, 70 % sont revenus en Chine, remettant en cause l’idée d’une domination durable de l’Occident.
Ces résultats mettent en évidence une “capacité système” croissante, où grandes équipes et pipelines institutionnels produisent des systèmes IA de pointe à grande échelle. Des modèles comme DeepSeek R1 et Moonshot Kimi K3 auraient été développés à une fraction du coût des équivalents occidentaux.
Une vague de lancements combinant grande échelle, coûts réduits et talents locaux solides signale une forte accélération de la course mondiale à l’IA, les laboratoires chinois comblant l’écart de performance tout en redéfinissant l’efficacité et l’économie du déploiement.