Retour au feed
arXiv cs.CL·

PADD: Path-Aligned Decompression Distillation for Non-Router Teacher to Guide MoE Student Learning

Signal
75
Hype
15
En 3 lignesPADD est une méthode de distillation de connaissance pour transformer un modèle dense en étudiant MoE sans routeur explicite. Le framework en 4 étapes (initialisation + entraînement) utilise le clustering de neurones du professeur et l'optimisation adaptative pour obtenir des gains sur les benchmarks de raisonnement mathématique, l'étudiant MoE égalant ou surpassant le professeur dense.
Lire la source
Ton avis ?
Fine-tuningRaisonnementBenchmarks

Résumé généré par Claude — vérifié par l'humain