Retour au feed
arXiv cs.LG·

DRIFT: Refining Instruction Data via On-Policy Data Attribution

Signal
78
Hype
15
En 3 lignesDRIFT affine la distribution des données d'entraînement SFT via des fonctions d'influence on-policy. La méthode utilise les rollouts du modèle comme cibles de validation pour minimiser l'écart de proximité et corriger le biais de norme de gradient. Tests sur modèles 7B montrent une amélioration du plafond de performance vs baselines.
Lire la source
Ton avis ?
Fine-tuningReinforcement learningÉvaluationsPapers

Résumé généré par Claude — vérifié par l'humain