Retour au feed
Reddit r/LocalLLaMA·

Maybe KV cache offload to RAM isn't bad

Signal
72
Hype
15
En 3 lignesUtilisateur llama.cpp démontre que l'offload KV cache vers RAM (option -nkvo) peut être avantageux. Sur RTX 5060 Ti 16GB + 32GB DDR5, avec Qwen 3.6 27B (IQ4_XS) : offload permet contexte 65k en f16 natif (19 tps pic) vs quantization q4_0 + 58 couches GPU (23 tps). Contexte 128k possible avec 63 couches GPU, vitesse stable. Trade-off performance acceptable pour flexibilité.
Lire la source
Ton avis ?
QwenOpen sourceInfrastructure

Résumé généré par Claude — vérifié par l'humain