Retour au feed
arXiv cs.CL·

Dialogue SWE-Bench: A Benchmark for Dialogue-Driven Coding Agents

Signal
78
Hype
22
En 3 lignesDialogue SWE-Bench est un benchmark automatisé pour évaluer les agents de codage via dialogue utilisateur. Les auteurs proposent un simulateur utilisateur persona-grounded et un agent schema-guided qui améliore les baselines de 3-14%. Résultat clé : les meilleurs modèles de code ne sont pas nécessairement les meilleurs en dialogue.
Lire la source
Ton avis ?
BenchmarksGénération de codeAgents IAPapers

Résumé généré par Claude — vérifié par l'humain