Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning
Signal
78
Hype
25
En 3 lignesÉtude arXiv sur l'amélioration du raisonnement long-contexte via une approche data-centric plutôt que l'ingénierie des récompenses. Recette de données ciblant retrieval, synthèse multi-preuves et raisonnement (~14K exemples). Tests sur Qwen3 (4B/8B/30B) : +7.2/+3.2/+6.4 points sur 7 benchmarks long-contexte, transfert aux tâches agentic (+4.8 GAIA, +7.0 BrowseComp).Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain