Continuous Audio Thinking for Large Audio Language Models
Signal
72
Hype
25
En 3 lignesContinuous Audio Thinking (CoAT) ajoute un espace latent continu aux modèles audio-langage pour préserver les informations acoustiques (phonétique, prosodie, affect, pitch) avant génération de texte. Testé sur Qwen2-Audio, Qwen2.5-Omni-7B et Audio Flamingo, CoAT améliore les performances en raisonnement audio, classification musicale et transcription sans coût de décodage supplémentaire.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain