Retour au feed
Reddit r/LocalLLaMA·

DiffusionGemma made me rethink what memory bandwidth means for local agent inference

Signal
65
Hype
25
En 3 lignesDiffusionGemma 26B A4B inverse le profil de goulot d'étranglement des modèles autorégressifs : au lieu d'être limité par la bande passante mémoire uniquement en décodage, il l'est à chaque étape de débruitage parallèle (256 tokens). Sur 3090, il atteint 180 tok/s contre 90 tok/s pour Qwen 3.5 7B. Pour les workflows d'agents, la génération parallèle offre une latence prévisible indépendante de la longueur de sortie.
Lire la source
Ton avis ?
Agents IABenchmarks

Résumé généré par Claude — vérifié par l'humain