Retour au feed
arXiv cs.LG·

The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models

Signal
78
Hype
15
En 3 lignesThéorie stéréologique de la couverture des benchmarks LLM. Pour d_eff ∈ [2.86, 4.80], le blind spot structural dépasse l'écart entre modèles de deux ordres de magnitude. Un algorithme glouton submodulaire identifie 4 benchmarks stables ; 7 sur 12 suffisent pour 90% de couverture. Validation sur 12 benchmarks internes et 27 catégories Chatbot Arena.
Lire la source
Ton avis ?
BenchmarksÉvaluations

Résumé généré par Claude — vérifié par l'humain