Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark
Signal
78
Hype
15
En 3 lignesÉtude arXiv mesurant la dépendance des VLMs aux priors textuels plutôt qu'au contenu visuel. Benchmark de 540 images avec 4 variantes de questions par image. 11 modèles testés : tous dégradent sur la variante la plus difficile, les modèles open-source chutent le plus. Ablation sans image réduit les modèles open à 1-9% de performance. GRPO post-training améliore la dépendance à l'image.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain