Retour au feed
arXiv cs.LG·

RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training

Signal
75
Hype
15
En 3 lignesÉtude arXiv montrant que l'RL appliqué directement aux checkpoints de pré-entraînement (sans SFT préalable) est efficace dès les étapes intermédiaires. La composition des données de pré-entraînement impacte plus l'efficacité de l'RL que la taille du modèle. Fusionner RL et SFT par moyennage parallèle surpasse les pipelines standards tout en préservant les capacités générales.
Lire la source
Ton avis ?
Reinforcement learningRaisonnementPapers

Résumé généré par Claude — vérifié par l'humain