Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation
Signal
75
Hype
25
En 3 lignesBenchmark AgentViSS évalue l'intelligence sociale visuelle d'agents multimodaux dans des simulations sociales. 240 scénarios, 585 rôles, 2340 instances testent si les MLLMs utilisent indices visuels (expressions, posture, regard) pour guider interactions. Sept modèles évalués montrent écart : expression et gestion de conflits proches saturation, régulation d'interaction et résultats visuels restent difficiles.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain