DRIFT: Refining Instruction Data via On-Policy Data Attribution
Signal
78
Hype
15
In three linesDRIFT refines SFT training data distribution using on-policy Influence Functions. The method uses model rollouts as validation targets to minimize proximity gap and debias gradient norm bias. Experiments on 7B instruction and reasoning models show consistent performance ceiling improvements over existing curation baselines.Read source
Your take?
Summary generated by Claude — human-verified