llama.cpp - how to free up even more space on your GPU
Signal
65
Hype
15
En 3 lignesllama.cpp optimise la gestion mémoire GPU. Les paramètres clés : --no-mmproj-offload libère 1GB pour modèles vision, --cache-type-k/v réduit KV cache de 50-75%, --spec-draft-n-max=2 optimise speculative decoding. Flash attention activé par défaut. Testé sur Qwen 3.6-27B avec contexte 150k sur RTX 3090.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain