Retour au feed
arXiv cs.AI·

WorkBench Revisited: Workplace Agents Two Years On

Signal
78
Hype
25
En 3 lignesWorkBench revisité (juin 2026) : Claude Opus 4.8 complète 89% des tâches vs 43% pour GPT-4 en mars 2024, avec 2.5% d'actions nuisibles involontaires vs 26%. Capacité et sécurité progressent ensemble. Les modèles open-weight réduisent drastiquement les coûts.
Lire la source
Ton avis ?
Agents IABenchmarksSécurité IAClaude

Résumé généré par Claude — vérifié par l'humain