Retour au feed
arXiv cs.AI·

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

Signal
72
Hype
18
En 3 lignesPTD-PO, un framework de distillation de politique pour optimiser les modèles vision-langage (2B-8B paramètres) via renforcement. Fournit une supervision dense au niveau des tokens sans exposer la réponse, utilisant des indices structurés (attention spatiale, étapes de raisonnement) et une divergence Jensen-Shannon Top-K pour stabiliser l'apprentissage.
Lire la source
Ton avis ?
VisionReinforcement learningRaisonnementPapers

Résumé généré par Claude — vérifié par l'humain