Back to feed
Reddit r/LocalLLaMA·

QAT MTP Heads Upload + PARALLEL=2 Fix + 12B 2-slot Bench

Signal
75
Hype
15
In three linesQAT-matched assistant heads for Gemma 4 (12B, 26B-A4B, 31B) released on HuggingFace for speculative decoding. PARALLEL=2 crash fixed in llama.cpp. QAT-matched heads improve acceptance rate by 7–35 percentage points vs non-QAT heads.
Read source
Your take?
Open sourceCode generationBenchmarks

Summary generated by Claude — human-verified