The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning
Signal
72
Hype
18
En 3 lignesLes modèles de raisonnement large (LRM) échouent en raisonnement spatial. Au lieu de fine-tuning supervisé, les auteurs proposent un cadre RL auto-supervisé utilisant des vérificateurs de cohérence (transformations géométriques et sémantiques). Ils introduisent OT-GRPO, une variante de GRPO basée sur le transport optimal, atteignant la performance des modèles supervisés sans annotations.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain