Retour au feed
Reddit r/LocalLLaMA·

QAT MTP Heads Upload + PARALLEL=2 Fix + 12B 2-slot Bench

Signal
75
Hype
15
En 3 lignesHeads d'assistance QAT-matched pour Gemma 4 (12B, 26B-A4B, 31B) publiés sur HuggingFace pour le décodage spéculatif. Correction du crash PARALLEL=2 dans llama.cpp. Les heads QAT-matched améliorent l'acceptance rate de 7 à 35 points de pourcentage vs heads non-QAT.
Lire la source
Ton avis ?
Open sourceGénération de codeBenchmarks

Résumé généré par Claude — vérifié par l'humain