MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs
Signal
78
Hype
15
En 3 lignesMODE est une méthode de quantification mixte-précision au niveau expert pour les modèles multimodaux MoE. Elle décompose la fréquence de sélection des experts par modalité (vision/texte) et filtre les tokens visuels redondants pour corriger les biais d'estimation. Résultats : perte de performance <2.9% en W3A16.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain