120 tok/s on 12GB VRAM with Gemma 4 12B QAT MTP
Signal
75
Hype
25
En 3 lignesGoogle a publié Gemma 4 12B en variante QAT (Quantization-Aware Training). Un utilisateur atteint 120 tok/s sur RTX 4070 Super 12GB avec llama.cpp en utilisant le speculative decoding MTP et un modèle assistant draft. Benchmark détaillé sur 9 tâches avec taux d'acceptation agrégé de 65,78%.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain