Retour au feed
arXiv cs.LG·

Less is MoE: Trimming Experts in Domain-Specialist Language Models

Signal
78
Hype
15
En 3 lignesFisher-MoE propose une compression des modèles Mixture-of-Experts en ciblant les dimensions intermédiaires des FFN plutôt que les experts entiers. Sur Qwen1.5-MoE, supprimer 12 des 1.35M dimensions critiques (identifiées par importance Fisher) préserve les performances tout en réduisant la mémoire de 45% et augmentant le débit d'inférence de 21%.
Lire la source
Ton avis ?
QwenBenchmarksFine-tuningInfrastructure

Résumé généré par Claude — vérifié par l'humain