Retour au feed
arXiv cs.CL·

ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

Signal
72
Hype
25
En 3 lignesProcessThinker améliore le raisonnement multimodal en fournissant des récompenses au niveau des étapes sans entraîner explicitement un modèle de récompense de processus. La méthode réécrire les traces de raisonnement, applique GRPO avec des récompenses basées sur des rollouts (taux de succès empirique), et améliore Qwen3-VL-8B-Instruct sur quatre benchmarks vidéo (Video-MMMU, MMVU, VideoMathQA, LongVideoBench).
Lire la source
Ton avis ?
RaisonnementReinforcement learningVisionBenchmarks

Résumé généré par Claude — vérifié par l'humain