Retour au feed
arXiv cs.CL·

Possible or Definite? A Benchmark for Evaluating Diagnostic Uncertainty Preservation in Clinical Text

Signal
78
Hype
15
En 3 lignesBenchmark d'évaluation de 1 200 documents cliniques avec 9 184 annotations d'incertitude diagnostique. Les LLM préservent mal les expressions d'incertitude (moins de 50% des cas) et confondent les niveaux adjacents. Révèle un défaut non détecté par les métriques standard.
Lire la source
Ton avis ?
BenchmarksSécurité IAÉvaluations

Résumé généré par Claude — vérifié par l'humain