Retour au feed
Reddit r/LocalLLaMA·

sycl : port multi-column MMVQ from CUDA backend (~45% speculative decoding speedup on Intel Arc) by masonmilby · Pull Request #21845 · ggml-org/llama.cpp

Signal
75
Hype
15
En 3 lignesPort SYCL du décodage spéculatif multi-colonne MMVQ depuis le backend CUDA vers llama.cpp. Gain de ~45% sur cartes Intel Arc. Mise à jour recommandée à partir de la version b9519.
Lire la source
Ton avis ?
Open sourceGénération de codeInfrastructure

Résumé généré par Claude — vérifié par l'humain