Minimizing the Hidden Cost of Scales: Graph-Guided Ultra-Low-Bit Quantization for Large Language Models
Signal
78
Hype
15
En 3 lignesSAGE-PTQ, une méthode de quantification ultra-faible précision pour LLM, réduit le coût caché des échelles en séparant poids saillants et non-saillants via statistiques distributionnelles et modélisation graphique. Sur LLaMA-3-8B : 6.74 perplexité WikiText2 vs 55.8 pour BiLLM, avec 50% moins de mémoire GPU. Sur LLaMA-2-70B : décodage 1.5x plus rapide sur NVIDIA L40.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain