Retour au feed
Reddit r/LocalLLaMA·

Not All MTP Assistants Are Created Equal

Signal
72
Hype
25
En 3 lignesExpérience avec MTP (Multi-Token Prediction) en speculative decoding sur llama.cpp. Les assistants MTP ne sont pas interchangeables : même nom et architecture ne garantissent pas les mêmes performances. Gemma 4 26B Q4 : ~30 t/s → 55-62 t/s avec le bon assistant. Les modèles assistants non quantifiés surpassent les versions Q4 (~10 t/s plus rapides).
Lire la source
Ton avis ?
LlamaGénération de codeBenchmarksOpen source

Résumé généré par Claude — vérifié par l'humain