Retour au feed
arXiv cs.AI·

VISTA: View-Consistent Self-Verified Training for GUI Grounding

Signal
78
Hype
15
En 3 lignesVISTA propose une méthode de fine-tuning basée sur GRPO pour améliorer le grounding GUI. Elle génère plusieurs vues du même écran (crops préservant l'élément cible) pour créer des groupes de comparaison plus robustes. Sur ScreenSpot-Pro, elle améliore Qwen3-VL 4B/8B/30B de 55.5/52.7/53.7 à 63.4/65.8/67.0.
Lire la source
Ton avis ?
Reinforcement learningVisionBenchmarksQwen

Résumé généré par Claude — vérifié par l'humain