Retour au feed
arXiv cs.AI·

Minimizing the Hidden Cost of Scales: Graph-Guided Ultra-Low-Bit Quantization for Large Language Models

Signal
78
Hype
15
En 3 lignesSAGE-PTQ, une méthode de quantification ultra-faible précision pour LLM, réduit le coût caché des échelles en séparant poids saillants et non-saillants via statistiques distributionnelles et modélisation graphique. Sur LLaMA-3-8B : 6.74 perplexité WikiText2 vs 55.8 pour BiLLM, avec 50% moins de mémoire GPU. Sur LLaMA-2-70B : décodage 1.5x plus rapide sur NVIDIA L40.
Lire la source
Ton avis ?
LlamaBenchmarks

Résumé généré par Claude — vérifié par l'humain