Retour au feed
Reddit r/LocalLLaMA·

KVarN: new KV-cache quant from Huawei. 3–5× KV cache compression with actual speed-up instead of slow-down, and unlike TurboQuant it holds up on reasoning (Apache 2.0, vLLM single flag)

Signal
78
Hype
35
En 3 lignesHuawei open-source KVarN, méthode de quantization KV-cache (Apache 2.0, intégration vLLM single flag). Compression 3–5× vs FP16, débit jusqu'à 1.4× FP16, préserve qualité reasoning contrairement à TurboQuant (Google). Pas de retraining, pas de calibration.
Lire la source
Ton avis ?
Open sourceInfrastructureBenchmarksRaisonnement

Résumé généré par Claude — vérifié par l'humain