Retour au feed
arXiv cs.LG·

TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition

Signal
75
Hype
25
En 3 lignesTD-Grokking décompose récursivement les problèmes sans récompense en sous-problèmes vérifiables pour générer des signaux d'entraînement. Testé sur tâches mathématiques et médicales, le framework surpasse GRPO vanilla et convertit les exemples zéro-récompense en signaux d'optimisation exploitables.
Lire la source
Ton avis ?
Reinforcement learningRaisonnementPapers

Résumé généré par Claude — vérifié par l'humain