2X tk/s (from 19.4 -> 38.1 tk/s on 1 x MI50) Playing with a hypothesis like speculative decoding.. but instead of an additional side model, exploiting that I can run multiple computations side-by-side AS IF I had Qwen3.6-27B loaded twice in memory - small quants don't use all the available compute.
Signal
65
Hype
25
En 3 lignesOptimisation de décodage spéculatif : doublement du débit (19.4 → 38.1 tk/s sur MI50) en exécutant plusieurs calculs parallèles avec le même modèle quantifié Q8, exploitant que les petites quantifications n'utilisent que 25% de la puissance de calcul disponible.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain