Retour au feed
arXiv cs.AI·

Towards Verifiable Agentic Data Science: Solving Irregular TSQA Via Tool-Grounded Reasoning

Signal
75
Hype
15
En 3 lignesIRTS-ToolBench, un benchmark de 1 700 questions sur 10 types de tâches et 13 domaines, évalue comment les LLM et agents IA traitent les séries temporelles irrégulières (asynchrones, valeurs manquantes informatives, fréquences variables). Comble le fossé entre benchmarks TSQA existants (données régulières) et déploiements réels.
Lire la source
Ton avis ?
Agents IABenchmarksRaisonnementOutils

Résumé généré par Claude — vérifié par l'humain