Temporal Difference Learning for Diffusion Models
Signal
72
Hype
18
En 3 lignesNouvelle approche d'entraînement pour modèles de diffusion utilisant la différence temporelle (TD) pour enforcer la cohérence multi-étapes le long de la trajectoire de débruitage. Reformulation du processus de diffusion comme processus de récompense Markov et problème d'évaluation de politique en RL. Amélioration significative du FID, particulièrement avec peu d'étapes d'échantillonnage.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain