Retour au feed
Reddit r/LocalLLaMA·

[Benchmark] DFlash Speculative Decoding + KV Cache Compression on RTX 5090 — 3.26x Speedup

Signal
78
Hype
15
En 3 lignesBenchmark de DFlash speculative decoding + compression KV cache sur RTX 5090 avec Qwen3.6-27B. Speedup 3.26x (turbo4/turbo4), 3.18x (q4_0/turbo4) avec dégradation PPL +0.02% seulement. Q5_K_XL surpasse NVFP4-Q8_0. Scripts et données disponibles.
Lire la source
Ton avis ?
QwenBenchmarksOpen source

Résumé généré par Claude — vérifié par l'humain