Back to feed
arXiv cs.LG·

DRIFT: Refining Instruction Data via On-Policy Data Attribution

Signal
78
Hype
15
In three linesDRIFT refines SFT training data distribution using on-policy Influence Functions. The method uses model rollouts as validation targets to minimize proximity gap and debias gradient norm bias. Experiments on 7B instruction and reasoning models show consistent performance ceiling improvements over existing curation baselines.
Read source
Your take?
Fine-tuningReinforcement learningEvalsPapers

Summary generated by Claude — human-verified