Retour au feed
arXiv cs.AI·

From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs

Signal
72
Hype
18
En 3 lignesÉtude d'interprétabilité sur les modèles audio-visuels (AVLLMs) : analyse du flux d'information entre tokens audio et visuels dans Qwen2.5-Omni et Video-SALMONN2 Plus (3B/7B). Les auteurs montrent que les tokens audio-visuels peuvent être supprimés après transfert d'information sans dégradation, améliorant l'efficacité d'inférence.
Lire la source
Ton avis ?
VisionVoixÉvaluationsPapers

Résumé généré par Claude — vérifié par l'humain