Retour au feed
arXiv cs.CL·

TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework

Signal
78
Hype
15
En 3 lignesTensorBench est un benchmark de 199 tâches de codage (ajouts de fonctionnalités et refactorisation) sur un framework tensor open-source basé compilateur étendant PyTorch. Évaluation de 7 agents de codage : taux de réussite de 64,8% (meilleur) à 22,1% (plus faible), avec faible accord inter-agents (κ=0,05 pour les deux meilleurs).
Lire la source
Ton avis ?
BenchmarksGénération de codeAgents IAÉvaluations

Résumé généré par Claude — vérifié par l'humain