LLM Compression with Jointly Optimizing Architectural and Quantization choices
Signal
78
Hype
22
En 3 lignesFramework NAS différentiable pour compresser les LLM en optimisant conjointement l'architecture et la quantization mixte des couches linéaires. Résultats : inférence 1.4x plus rapide que NAS séquentiel + quantization, ou +6% de précision moyenne sur 7 tâches de reasoning à latence équivalente.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain