CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework
Signal
72
Hype
25
En 3 lignesCaVe-VLM-CoT est un framework agentic-RAG modulaire qui réduit les hallucinations des VLMs via une pipeline fermée à 5 étapes (Extractor, Retriever, Solver, Citation Injector, Verifier). Les réclamations non fondées déclenchent une re-retrieval ciblée. 23 métriques composantes et CaVeScore mesurent la fidélité des citations et l'ancrage multimodal. Résultats : 87,1% accuracy sur ScienceQA, 55,2% sur MMMU.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain