Retour au feed
arXiv cs.CL·

Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation

Signal
78
Hype
25
En 3 lignesNouvelle méthode OPDLM pour transformer des modèles autorégressifs en modèles de diffusion sans réentraînement complet. Via distillation on-policy, le modèle étudiant génère ses propres trajectoires tandis que le modèle original gèle fournit les logits cibles. Résultat : 15x à 7000x moins de tokens d'entraînement requis.
Lire la source
Ton avis ?
Fine-tuningRaisonnementPapers

Résumé généré par Claude — vérifié par l'humain