Joint Structural Pruning and Mixed-Precision Quantization for LLM Compression
Signal
78
Hype
15
En 3 lignesNouvelle méthode de compression pour LLM combinant élagage structurel et quantification mixte-précision. Le framework optimise globalement la propagation d'erreur à travers le réseau plutôt que par couche. À 1-3 bits, réduit la perplexité WikiText de 21% vs baselines SoTA et de 59-85% vs méthodes weight-only.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain