Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models
Signal
72
Hype
18
En 3 lignesSA-AH-GRPO, extension de GRPO, applique un discount asymétrique basé sur l'entropie aux tokens pour l'RL des LLMs. Sur GSM8K, le modèle Qwen 2.5-3B atteint Pass@1=0.858 avec variance réduite 3.6× vs GRPO standard, tout en préservant les gradients sur les trajectoires correctes.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain