Constructing Evaluation Datasets for Procedural Reasoning: Balancing Naturalness, Grounding, and Multi-Hop Coverage
Signal
72
Hype
15
En 3 lignesÉtude sur la génération de datasets d'évaluation pour le raisonnement procédural. Trois stratégies comparées : génération stricte depuis modèles TMK (Task-Method-Knowledge), génération basée transcripts avec filtrage TMK post-hoc, et génération TMK-aware. Sur 690 paires question-réponse et 23 sujets, la génération stricte atteint 96,5% de questions ancrées et 92,6% utilisables.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain