Retour au feed
arXiv cs.CL·

MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights

Signal
78
Hype
25
En 3 lignesMADE est un moteur d'analyse multilingue basé sur des agents qui décompose l'évaluation post-benchmark en planification, analyse agrégée, inspection d'instances et synthèse de rapports. Évalué sur 33 familles de modèles, 11 benchmarks et 26 langues (8,66M enregistrements), MADE surpasse les baselines de 47% en qualité de diagnostic et est préféré par 87,9% des experts humains.
Lire la source
Ton avis ?
Agents IAMulti-agentsÉvaluationsBenchmarks

Résumé généré par Claude — vérifié par l'humain