DRIFT: Refining Instruction Data via On-Policy Data Attribution
Signal
78
Hype
15
En 3 lignesDRIFT affine la distribution des données d'entraînement SFT via des fonctions d'influence on-policy. La méthode utilise les rollouts du modèle comme cibles de validation pour minimiser l'écart de proximité et corriger le biais de norme de gradient. Tests sur modèles 7B montrent une amélioration du plafond de performance vs baselines.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain