CEO-Bench: Can Agents Play the Long Game?
CEO-Bench évalue la capacité des agents IA à gérer des tâches complexes sur long terme en simulant l'exploitation d'une startup pendant 500 jours. L'agent doit gérer tarification, marketing, budgétisation via une interface Python. Seuls Claude Opus 4.8 et GPT-5.5 dépassent le bilan initial d'1M$, sans profit constant.