Pipeline parallelism in llama.cpp may be wasting your VRAM
llama.cpp active par défaut le pipeline parallelism qui consomme 4x plus de VRAM sans gain de vitesse. Désactiver avec -DGGML_SCHED_MAX_COPIES=1 réduit l'allocation mémoire sans impact sur les performances (testé sur Vulkan avec Qwen 27B).