Retour au feed
arXiv cs.LG·

PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation

Signal
78
Hype
15
En 3 lignesPowerOPD stabilise la distillation on-policy pour LLM en remplaçant la récompense log-ratio non-bornée par une transformation Box-Cox paramétrée. Sur 6 benchmarks de raisonnement mathématique avec Qwen3, gains de +6.37 Avg@8/+5.71 Pass@8 vs OPD vanilla, réduction de 59.2% du temps et 23.1% de mémoire GPU.
Lire la source
Ton avis ?
Fine-tuningReinforcement learningBenchmarksPapers

Résumé généré par Claude — vérifié par l'humain