llama-server router: a model pinned to one GPU still grabs a CUDA context on every card, so it OOMs when my others are full. Am I missing a flag or is this just how it is?
Signal
65
Hype
15
En 3 lignesUtilisateur signale que llama-server en mode router alloue un contexte CUDA sur toutes les cartes GPU même quand un modèle est épinglé à une seule. Gemma 4B sur RTX 5060 Ti réserve ~256 MiB sur chaque 3090 et ~120 sur 4060 Ti, causant des OOM quand les 3090s sont saturées. Le problème vient de l'héritage de l'env du router par les enfants sans `CUDA_VISIBLE_DEVICES` par modèle.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain