Retour au feed
arXiv cs.LG·

Rethinking Groups in Critic-Free RLVR

Signal
72
Hype
15
En 3 lignesArticle arXiv sur l'apprentissage par renforcement sans critique pour les LLM. Les auteurs remettent en question le rôle des « groupes » de rollouts dans les méthodes existantes et proposent le « negative token filtering » pour permettre un entraînement stable avec un seul rollout, améliorant les performances sur les tâches d'agents.
Lire la source
Ton avis ?
Reinforcement learningRaisonnementAgents IA

Résumé généré par Claude — vérifié par l'humain