Not All MTP Assistants Are Created Equal
Signal
72
Hype
25
En 3 lignesExpérience avec MTP (Multi-Token Prediction) en speculative decoding sur llama.cpp. Les assistants MTP ne sont pas interchangeables : même nom et architecture ne garantissent pas les mêmes performances. Gemma 4 26B Q4 : ~30 t/s → 55-62 t/s avec le bon assistant. Les modèles assistants non quantifiés surpassent les versions Q4 (~10 t/s plus rapides).Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain