Back to feed
Reddit r/LocalLLaMA·

DiffusionGemma 26B A4B results on my 5090

Signal
75
Hype
15
In three linesDiffusionGemma 26B A4B quantization benchmarks (Q6_K 22GB, Q4_K_M 16GB) on RTX 5090. Stable context: 6,144 tokens (Q6_K) and 10,240 tokens (Q4_K_M) limited by disabled Flash Attention on SM120. Optimal parameters and llama.cpp invocations documented.
Read source
Your take?
GeminiCode generationBenchmarksOpen sourceInfrastructure

Summary generated by Claude — human-verified