Retour au feed
Reddit r/LocalLLaMA·

Pipeline parallelism in llama.cpp may be wasting your VRAM

Signal
72
Hype
15
En 3 lignesllama.cpp active par défaut le pipeline parallelism qui consomme 4x plus de VRAM sans gain de vitesse. Désactiver avec -DGGML_SCHED_MAX_COPIES=1 réduit l'allocation mémoire sans impact sur les performances (testé sur Vulkan avec Qwen 27B).
Lire la source
Ton avis ?
LlamaOpen sourceInfrastructure

Résumé généré par Claude — vérifié par l'humain