EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation
EDGE-OPD améliore la distillation on-policy auto-supervisée (OPSD) en utilisant des rollouts guidés et un masque d'évidence pour transférer efficacement un contexte privilégié (persona, fait privé, solution détaillée) sans dégrader les capacités générales du modèle. Les expériences montrent que l'OPSD standard échoue sur les identités rares, tandis que EDGE-OPD réussit.