TD-Grokking: Learning from Zero-Reward Problems by Training-Time Decomposition
Signal
75
Hype
25
En 3 lignesTD-Grokking décompose récursivement les problèmes sans récompense en sous-problèmes vérifiables pour générer des signaux d'entraînement. Testé sur tâches mathématiques et médicales, le framework surpasse GRPO vanilla et convertit les exemples zéro-récompense en signaux d'optimisation exploitables.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain