DiffusionGemma made me rethink what memory bandwidth means for local agent inference
Signal
65
Hype
25
En 3 lignesDiffusionGemma 26B A4B inverse le profil de goulot d'étranglement des modèles autorégressifs : au lieu d'être limité par la bande passante mémoire uniquement en décodage, il l'est à chaque étape de débruitage parallèle (256 tokens). Sur 3090, il atteint 180 tok/s contre 90 tok/s pour Qwen 3.5 7B. Pour les workflows d'agents, la génération parallèle offre une latence prévisible indépendante de la longueur de sortie.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain