DiffusionGemma 26B A4B results on my 5090
Signal
75
Hype
15
In three linesDiffusionGemma 26B A4B quantization benchmarks (Q6_K 22GB, Q4_K_M 16GB) on RTX 5090. Stable context: 6,144 tokens (Q6_K) and 10,240 tokens (Q4_K_M) limited by disabled Flash Attention on SM120. Optimal parameters and llama.cpp invocations documented.Read source
Your take?
Summary generated by Claude — human-verified