Retour au feed
arXiv cs.LG·

Temporal Difference Learning for Diffusion Models

Signal
72
Hype
18
En 3 lignesNouvelle approche d'entraînement pour modèles de diffusion utilisant la différence temporelle (TD) pour enforcer la cohérence multi-étapes le long de la trajectoire de débruitage. Reformulation du processus de diffusion comme processus de récompense Markov et problème d'évaluation de politique en RL. Amélioration significative du FID, particulièrement avec peu d'étapes d'échantillonnage.
Lire la source
Ton avis ?
Reinforcement learningRaisonnement

Résumé généré par Claude — vérifié par l'humain