The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer
Signal
78
Hype
15
En 3 lignesLes modèles élaguées passent les benchmarks à choix multiples mais échouent en génération ouverte. Étude multilingue montrant que sous élagage haute sparsité (Wanda), les réponses correctes sont démotées plutôt qu'effacées : elles réapparaissent avec beam search ou sampling. Les benchmarks à choix multiples surestiment l'utilisabilité des LLM compressés.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain