Retour au feed
arXiv cs.CL·

AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints

Signal
78
Hype
15
En 3 lignesAdaPlanBench est un benchmark interactif évaluant la capacité des agents LLM à planifier et replanifier face à des contraintes monde et utilisateur révélées progressivement. Construit sur 307 tâches ménagères, il teste 10 modèles leaders : le meilleur atteint 67,75% de précision. Les performances se dégradent avec l'accumulation de contraintes, notamment les contraintes utilisateur.
Lire la source
Ton avis ?
Agents IARaisonnementBenchmarksÉvaluations

Résumé généré par Claude — vérifié par l'humain