Retour au feed
arXiv cs.CL·

Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports

Signal
72
Hype
15
En 3 lignesÉtude sur l'évaluation des rapports radiologiques générés par IA. Les chercheurs montrent que les LLM existants pénalisent excessivement les reformulations inoffensives tout en détectant les erreurs cliniques. Ils entraînent des métriques légères sur Qwen3-8B et MedGemma-4B surpassant des modèles médicaux 32B, avec publication du dataset et de la métrique.
Lire la source
Ton avis ?
BenchmarksÉvaluationsPapersSécurité IAQwen

Résumé généré par Claude — vérifié par l'humain