CEO-Bench: Can Agents Play the Long Game?
Signal
78
Hype
25
En 3 lignesCEO-Bench évalue la capacité des agents IA à gérer des tâches complexes sur long terme en simulant l'exploitation d'une startup pendant 500 jours. L'agent doit gérer tarification, marketing, budgétisation via une interface Python. Seuls Claude Opus 4.8 et GPT-5.5 dépassent le bilan initial d'1M$, sans profit constant.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain