Retour au feed
arXiv cs.CL·

Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning

Signal
75
Hype
15
En 3 lignesCadre d'entraînement SFT-puis-RL pour petits modèles de langage : SFT acquiert les compétences de raisonnement non maîtrisées, RL les consolide. Mécanisme Bridge transforme les traces de raisonnement brutes en supervision apprenante. Critique Fine-Tuning convertit les échecs en supervision diagnostique. Améliorations consistantes sur cinq benchmarks de raisonnement.
Lire la source
Ton avis ?
Fine-tuningReinforcement learningRaisonnementBenchmarks

Résumé généré par Claude — vérifié par l'humain