TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework
Signal
78
Hype
15
En 3 lignesTensorBench est un benchmark de 199 tâches de codage (ajouts de fonctionnalités et refactorisation) sur un framework tensor open-source basé compilateur étendant PyTorch. Évaluation de 7 agents de codage : taux de réussite de 64,8% (meilleur) à 22,1% (plus faible), avec faible accord inter-agents (κ=0,05 pour les deux meilleurs).Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain