Retour au feed
arXiv cs.AI·

DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks

Signal
78
Hype
25
En 3 lignesDailyReport est un benchmark open-source pour évaluer les agents de recherche (SA) sur 150 tâches quotidiennes réelles avec 3 546 rubriques d'évaluation. Les tâches sont décomposées en sous-tâches avec évaluation en cascade sur dimensions disentanglées. Tests sur 17 systèmes agentic montrent des lacunes significatives par rapport aux attentes utilisateurs.
Lire la source
Ton avis ?
Agents IABenchmarksÉvaluationsOpen source

Résumé généré par Claude — vérifié par l'humain