RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning
Signal
78
Hype
15
En 3 lignesRealMath-Eval, un benchmark de 224 réponses d'examen réelles, révèle que les juges LLM état-de-l'art échouent à évaluer le raisonnement humain authentique (MSE ~2.96 vs ~1.17 sur solutions synthétiques). L'analyse montre que les erreurs humaines forment un espace d'erreurs plus diversifié que les erreurs synthétiques, avec une surprisal informationnelle plus élevée.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain