Pipeline parallelism in llama.cpp may be wasting your VRAM
Signal
72
Hype
15
En 3 lignesllama.cpp active par défaut le pipeline parallelism qui consomme 4x plus de VRAM sans gain de vitesse. Désactiver avec -DGGML_SCHED_MAX_COPIES=1 réduit l'allocation mémoire sans impact sur les performances (testé sur Vulkan avec Qwen 27B).Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain