KVarN: Variance-Normalized KV-Cache Quantization [R]
KVarN est une méthode de quantification KV-Cache combinant rotations Hadamard et normalisation de variance sur K et V. Atteint 3-4x compression avec 0-1% de perte sur AIME24 et accélération en vLLM. Optimisé pour settings decode-heavy (reasoning, code-gen, agents).