Retour au feed
arXiv cs.CL·

Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus

Signal
78
Hype
15
En 3 lignesXBCP, un benchmark contrôlé, évalue des agents de recherche profonde sur leur capacité à opérer en contexte multilingue. Quatre agents testés avec des retrievers denses et creux sur 12 langues montrent une dégradation significative : perte de recall, calibration réduite, citations moins fiables. Les problèmes persistent même avec l'or evidence fourni directement.
Lire la source
Ton avis ?
Agents IARAGBenchmarksÉvaluations

Résumé généré par Claude — vérifié par l'humain