Retour au feed
arXiv cs.LG·

MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

Signal
78
Hype
15
En 3 lignesMODE est une méthode de quantification mixte-précision au niveau expert pour les modèles multimodaux MoE. Elle décompose la fréquence de sélection des experts par modalité (vision/texte) et filtre les tokens visuels redondants pour corriger les biais d'estimation. Résultats : perte de performance <2.9% en W3A16.
Lire la source
Ton avis ?
VisionBenchmarksPapers

Résumé généré par Claude — vérifié par l'humain