Back to feed
arXiv cs.CL·

LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling

Signal
78
Hype
15
In three linesLoHoSearch is a 544-question benchmark for evaluating long-horizon search agents, built via an automated pipeline on a knowledge graph of 7 million Wikipedia entities. The strongest model achieves only 34.74% accuracy, versus >90% on prior saturated benchmarks.
Read source
Your take?
BenchmarksAI AgentsReasoning

Summary generated by Claude — human-verified