Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning
Signal
72
Hype
35
En 3 lignesVisual-Seeker est un agent de recherche multimodal qui améliore le raisonnement visuel des MLLMs dans des scénarios complexes. L'approche utilise un pipeline de raisonnement visuel actif et 5K trajectoires multimodales synthétiques pour entraîner le modèle. L'agent atteint des performances SOTA sur cinq benchmarks de recherche multimodal, surpassant certains modèles propriétaires.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain