LEVANTE-bench: Multi-Scale Comparison of VLMs to Children Using Cognitive Tasks (or, "Is Your VLM Smarter Than a 5th Grader?")
Signal
78
Hype
25
En 3 lignesLEVANTE-bench compare 6 modèles de vision-langage (VLMs) à des enfants de 5-12 ans (N=1547) sur des tâches cognitives standardisées dans 3 pays. Les modèles plus grands s'alignent mieux globalement, mais les petits modèles reproduisent mieux les erreurs des jeunes enfants. Les VLMs échouent sur le raisonnement matriciel et la rotation mentale.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain