Retour au feed
Reddit r/LocalLLaMA·

120 tok/s on 12GB VRAM with Gemma 4 12B QAT MTP

Signal
75
Hype
25
En 3 lignesGoogle a publié Gemma 4 12B en variante QAT (Quantization-Aware Training). Un utilisateur atteint 120 tok/s sur RTX 4070 Super 12GB avec llama.cpp en utilisant le speculative decoding MTP et un modèle assistant draft. Benchmark détaillé sur 9 tâches avec taux d'acceptation agrégé de 65,78%.
Lire la source
Ton avis ?
GeminiGénération de codeBenchmarksOpen sourceOutils

Résumé généré par Claude — vérifié par l'humain