Retour au feed
arXiv cs.CL·

Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models

Signal
78
Hype
15
En 3 lignesCAPR est un algorithme de reinforcement learning pour modèles de diffusion (dLLMs) qui exploite la trace de débruitage pour générer des signaux de supervision granulaires sans coût computationnel d'arbre complet. L'approche réduit le coût de rollout à 0.75x des méthodes plates et 0.6x des arbres, atteignant SOTA sur Sudoku 4x4, Countdown, GSM8K et Math500.
Lire la source
Ton avis ?
Reinforcement learningRaisonnementBenchmarks

Résumé généré par Claude — vérifié par l'humain