Architecture proposée pour l'inférence de modèles MoE sparsés avec augmentation des paramètres actifs
8/10Une nouvelle approche d'architecture propose un déclin en couches et linéaire pour augmenter le nombre de paramètres actifs dans les modèles Mixture of Experts (MoE) sparsés sans nécessiter d'entraînement ou de fine-tuning. Cette méthode, testée sur le modèle Qwen 3.6 35B via llama.cpp, permet de router plus d'experts par requête que la méthode top-K native, améliorant ainsi la scalabilité de l'inférence à faible coût.
