Retour au feed
arXiv cs.AI·

LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings

Signal
75
Hype
20
En 3 lignesLongWebBench est un benchmark évaluant la génération de pages web longues par des modèles vision-langage. Il contient 490 pages réelles pour l'évaluation structurelle et 507 tâches interactives sur 129 pages. Les expériences montrent que la fidélité structurelle se dégrade avec la longueur et que les générations visuellement plausibles échouent souvent à supporter les interactions multi-étapes.
Lire la source
Ton avis ?
VisionBenchmarksAgents IAGénération de code

Résumé généré par Claude — vérifié par l'humain