Retour au feed
Reddit r/LocalLLaMA·

An Implementation of NanoQuant: A flexible binary quantization method

Signal
72
Hype
25
En 3 lignesNanoQuant est une méthode de quantification post-entraînement qui compresse les modèles transformers denses à 1-bit et sub-1-bit par poids. L'implémentation utilise une factorisation en matrices binaires avec vecteurs d'échelle, permettant des ratios de compression jusqu'à 16x sur matrices f16. Une étape de fine-tuning est nécessaire pour aligner les sorties quantifiées.
Lire la source
Ton avis ?
Open sourcePapersFine-tuning

Résumé généré par Claude — vérifié par l'humain