Retour au feed
arXiv cs.CL·

Retrospective Progress-Aware Self-Refinement for LLM Agent Training

Signal
78
Hype
25
En 3 lignesRePro, un framework d'entraînement pour agents LLM, enseigne aux modèles à générer rétrospectivement des signaux de progrès via un paradigme forward-then-reflect. Testé sur WebShop, ALFWorld et Sokoban avec la famille Qwen, RePro atteint +12% de gain absolu en taux de succès sans supervision externe continue.
Lire la source
Ton avis ?
Agents IAReinforcement learningRaisonnementQwen

Résumé généré par Claude — vérifié par l'humain