ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward
Signal
72
Hype
25
En 3 lignesProcessThinker améliore le raisonnement multimodal en fournissant des récompenses au niveau des étapes sans entraîner explicitement un modèle de récompense de processus. La méthode réécrire les traces de raisonnement, applique GRPO avec des récompenses basées sur des rollouts (taux de succès empirique), et améliore Qwen3-VL-8B-Instruct sur quatre benchmarks vidéo (Video-MMMU, MMVU, VideoMathQA, LongVideoBench).Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain