Retour au feed
arXiv cs.CL·

LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling

Signal
78
Hype
15
En 3 lignesLoHoSearch est un benchmark de 544 questions pour évaluer les agents de recherche long-horizon, construit via un pipeline automatisé sur un graphe de connaissances de 7 millions d'entités Wikipedia. Le modèle le plus performant atteint seulement 34,74% de précision, contre >90% sur les benchmarks précédents saturés.
Lire la source
Ton avis ?
BenchmarksAgents IARaisonnement

Résumé généré par Claude — vérifié par l'humain