PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation
Signal
78
Hype
15
En 3 lignesPowerOPD stabilise la distillation on-policy pour LLM en remplaçant la récompense log-ratio non-bornée par une transformation Box-Cox paramétrée. Sur 6 benchmarks de raisonnement mathématique avec Qwen3, gains de +6.37 Avg@8/+5.71 Pass@8 vs OPD vanilla, réduction de 59.2% du temps et 23.1% de mémoire GPU.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain