SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR
Signal
78
Hype
15
En 3 lignesL'étude montre que l'overtraining en SFT peut inverser le classement des modèles lors du fine-tuning RLVR. Sur Qwen2.5-Coder-3B, l'augmentation de la profondeur SFT élève pass@1 pré-RL mais réduit pass@10 GRPO de 0.806 à 0.481. L'entropie pré-RL corrèle positivement avec les résultats RLVR (ρ=+0.69). Un diagnostic deux étapes basé sur l'entropie peut identifier les checkpoints à risque.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain