Are We Evaluating Knowledge or Phrasing? Mitigating MCQA Sensitivity with ParaEval
Signal
75
Hype
15
En 3 lignesParaEval, un framework d'évaluation, corrige les biais des benchmarks MCQA en testant les modèles avec plusieurs paraphrases par option. Les scores standards confondent familiarité avec une formulation exacte et vraie compréhension. Sur modèles 1B-8B avec connaissances identiques, ParaEval réduit les écarts de performance artificiels de 2 points à moins de 1 point.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain