Retour au feed
Reddit r/LocalLLaMA·

llama.cpp - how to free up even more space on your GPU

Signal
65
Hype
15
En 3 lignesllama.cpp optimise la gestion mémoire GPU. Les paramètres clés : --no-mmproj-offload libère 1GB pour modèles vision, --cache-type-k/v réduit KV cache de 50-75%, --spec-draft-n-max=2 optimise speculative decoding. Flash attention activé par défaut. Testé sur Qwen 3.6-27B avec contexte 150k sur RTX 3090.
Lire la source
Ton avis ?
LlamaOpen sourceInfrastructureVision

Résumé généré par Claude — vérifié par l'humain