Retour au feed
arXiv cs.CL·

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

Signal
72
Hype
18
En 3 lignesMCBench est un benchmark de sécurité pour modèles omnimodaux (vision, audio, texte) contenant 1196 scénarios répartis en 4 catégories. Les évaluations montrent que les LLMs omnimodaux actuels peinent à intégrer les indices multimodaux pour les jugements de sécurité, notamment sur les risques subtils.
Lire la source
Ton avis ?
BenchmarksSécurité IAVisionVoixRaisonnement

Résumé généré par Claude — vérifié par l'humain