Retour au feed
arXiv cs.CL·

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

Signal
78
Hype
25
En 3 lignesÉtude arXiv sur l'amélioration du raisonnement long-contexte via une approche data-centric plutôt que l'ingénierie des récompenses. Recette de données ciblant retrieval, synthèse multi-preuves et raisonnement (~14K exemples). Tests sur Qwen3 (4B/8B/30B) : +7.2/+3.2/+6.4 points sur 7 benchmarks long-contexte, transfert aux tâches agentic (+4.8 GAIA, +7.0 BrowseComp).
Lire la source
Ton avis ?
Reinforcement learningRaisonnementAgents IABenchmarksQwen

Résumé généré par Claude — vérifié par l'humain