Gaussian Mixture Attention: Linear-Time Sequence Mixing via Probabilistic Latent Routing
Signal
72
Hype
15
En 3 lignesGaussian Mixture Attention (GMA) remplace l'attention standard par un routage probabiliste via K composantes gaussiennes apprises. Queries et keys sont mappées à des vecteurs de responsabilité dans un espace latent partagé. GMA évite la matrice N×N explicite et réduit la complexité mémoire à O(NK) au lieu de O(N²). Compétitif sur classification long-contexte, mais derrière SDPA et Mamba sur WikiText-103.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain