Retour au feed
arXiv cs.AI·

Joint Structural Pruning and Mixed-Precision Quantization for LLM Compression

Signal
78
Hype
15
En 3 lignesNouvelle méthode de compression pour LLM combinant élagage structurel et quantification mixte-précision. Le framework optimise globalement la propagation d'erreur à travers le réseau plutôt que par couche. À 1-3 bits, réduit la perplexité WikiText de 21% vs baselines SoTA et de 59-85% vs méthodes weight-only.
Lire la source
Ton avis ?
Fine-tuningBenchmarksInfrastructure

Résumé généré par Claude — vérifié par l'humain