Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation
Signal
78
Hype
25
En 3 lignesNouvelle méthode OPDLM pour transformer des modèles autorégressifs en modèles de diffusion sans réentraînement complet. Via distillation on-policy, le modèle étudiant génère ses propres trajectoires tandis que le modèle original gèle fournit les logits cibles. Résultat : 15x à 7000x moins de tokens d'entraînement requis.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain