AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints
Signal
78
Hype
15
En 3 lignesAdaPlanBench est un benchmark interactif évaluant la capacité des agents LLM à planifier et replanifier face à des contraintes monde et utilisateur révélées progressivement. Construit sur 307 tâches ménagères, il teste 10 modèles leaders : le meilleur atteint 67,75% de précision. Les performances se dégradent avec l'accumulation de contraintes, notamment les contraintes utilisateur.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain