Retour au feed
Reddit r/LocalLLaMA·

DiffusionGemma 26B A4B results on my 5090

Signal
75
Hype
15
En 3 lignesBenchmarks de DiffusionGemma 26B A4B quantifié (Q6_K 22GB, Q4_K_M 16GB) sur RTX 5090. Contexte stable : 6,144 tokens (Q6_K) et 10,240 tokens (Q4_K_M) limités par l'absence de Flash Attention sur SM120. Paramètres optimaux et invocations llama.cpp documentés.
Lire la source
Ton avis ?
GeminiGénération de codeBenchmarksOpen sourceInfrastructure

Résumé généré par Claude — vérifié par l'humain