RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training
Signal
75
Hype
15
En 3 lignesÉtude arXiv montrant que l'RL appliqué directement aux checkpoints de pré-entraînement (sans SFT préalable) est efficace dès les étapes intermédiaires. La composition des données de pré-entraînement impacte plus l'efficacité de l'RL que la taille du modèle. Fusionner RL et SFT par moyennage parallèle surpasse les pipelines standards tout en préservant les capacités générales.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain