Retour au feed
arXiv cs.LG·

Diffusion Policy Optimization without Drifting Apart

Signal
78
Hype
15
En 3 lignesDiPOD, une méthode d'optimisation de politiques de diffusion, résout l'instabilité du post-training RL en identifiant le phénomène de double-drift (divergence entre ELBO et log-vraisemblance). L'approche intercale auto-distillation et mises à jour de gradient, stabilisant l'entraînement sur modèles de langage et contrôle continu.
Lire la source
Ton avis ?
Reinforcement learningRaisonnementPapers

Résumé généré par Claude — vérifié par l'humain