Retour au feed
arXiv cs.CL·

EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge

Signal
78
Hype
25
En 3 lignesEvoBrowseComp est un benchmark évolutif de 400 questions en anglais et 400 en chinois pour évaluer les agents de recherche (LLM + outils web). Contrairement à BrowseComp statique, il utilise une traversée web en direct et un cadre à trois agents (synthèse QA, filtrage d'information, guidance) pour éviter la contamination et la mémorisation paramétrique. Le benchmark se met à jour automatiquement.
Lire la source
Ton avis ?
Agents IABenchmarksÉvaluationsRaisonnement

Résumé généré par Claude — vérifié par l'humain