Retour au feed
arXiv cs.CL·

The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

Signal
78
Hype
15
En 3 lignesLes modèles élaguées passent les benchmarks à choix multiples mais échouent en génération ouverte. Étude multilingue montrant que sous élagage haute sparsité (Wanda), les réponses correctes sont démotées plutôt qu'effacées : elles réapparaissent avec beam search ou sampling. Les benchmarks à choix multiples surestiment l'utilisabilité des LLM compressés.
Lire la source
Ton avis ?
BenchmarksÉvaluationsFine-tuning

Résumé généré par Claude — vérifié par l'humain