Retour au feed
Reddit r/LocalLLaMA·

I implemented KVarN in my llama.cpp fork and ran KLD benchmarks. It's promising!

Signal
72
Hype
35
En 3 lignesImplémentation de KVarN (quantification KV-cache de Huawei) dans llama.cpp fork. Compression 3-5× du cache KV avec amélioration de vitesse. Benchmarks KLD montrent qualité q5 à 4-bit, q4 à 3.5-bit. Disponible en BeeLlama.cpp v0.3.2 avec flags --cache-type-k/v kvarn4.
Lire la source
Ton avis ?
LlamaBenchmarksOpen source

Résumé généré par Claude — vérifié par l'humain