Retour au feed
Reddit r/LocalLLaMA·

2X tk/s (from 19.4 -> 38.1 tk/s on 1 x MI50) Playing with a hypothesis like speculative decoding.. but instead of an additional side model, exploiting that I can run multiple computations side-by-side AS IF I had Qwen3.6-27B loaded twice in memory - small quants don't use all the available compute.

Signal
65
Hype
25
En 3 lignesOptimisation de décodage spéculatif : doublement du débit (19.4 → 38.1 tk/s sur MI50) en exécutant plusieurs calculs parallèles avec le même modèle quantifié Q8, exploitant que les petites quantifications n'utilisent que 25% de la puissance de calcul disponible.
Lire la source
Ton avis ?
Open source

Résumé généré par Claude — vérifié par l'humain