Less is MoE: Trimming Experts in Domain-Specialist Language Models
Signal
78
Hype
15
En 3 lignesFisher-MoE propose une compression des modèles Mixture-of-Experts en ciblant les dimensions intermédiaires des FFN plutôt que les experts entiers. Sur Qwen1.5-MoE, supprimer 12 des 1.35M dimensions critiques (identifiées par importance Fisher) préserve les performances tout en réduisant la mémoire de 45% et augmentant le débit d'inférence de 21%.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain