Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle
Signal
78
Hype
25
En 3 lignesAARRI-Bench évalue les agents IA sur des tâches de recherche scientifique granulaires. Même la meilleure configuration (Mini-SWE-Agent + Claude Opus 4.7) atteint 68,3% de succès, révélant des lacunes en jugement nuancé et éthique. Le benchmark cible la capacité à émuler le professionnalisme des chercheurs humains, au-delà de l'exécution macro.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain