Retour au feed
Reddit r/LocalLLaMA·

Vista 9B/4B from inclusionAI

Signal
72
Hype
25
En 3 lignesinclusionAI publie VISTA-9B et VISTA-4B, modèles vision-langage basés sur Qwen 3.5 pour le grounding GUI. Entraînés avec VISTA (View-Consistent Self-Verified Training), ils mappent captures d'écran + instructions en coordonnées de clic normalisées 0-1000. Utilise GRPO avec vues préservant la cible et ancrage cross-view auto-vérifié.
Lire la source
Ton avis ?
QwenVisionAgents IAOpen source

Résumé généré par Claude — vérifié par l'humain