Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models
Signal
78
Hype
15
En 3 lignesLes modèles de raisonnement entraînés par RL génèrent souvent du raisonnement inutile après avoir trouvé la bonne réponse (overthinking). Cet article propose Dynamic Rollout Editing (DRE), une intervention au moment de l'entraînement GRPO qui édite les trajectoires réussies continuant après l'émergence de la réponse, préservant le préfixe vérifié et affaiblissant le signal de préférence pour la pensée inutile.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain