Retour au feed
arXiv cs.CL·

RedactionBench

Signal
78
Hype
25
En 3 lignesRedactionBench est un benchmark de 200 documents annotés manuellement couvrant 11 domaines pour évaluer la redaction d'informations personnelles (PII) en contexte. Introduit avec R-Score, une métrique au niveau caractère, il montre que 35 modèles (NER, SLM, frontier models) échouent sur les redactions contextuelles : consensus humain à 89,4% pour redactions obligatoires, 47,7% pour redactions contextuelles.
Lire la source
Ton avis ?
BenchmarksSécurité IAÉvaluationsPapers

Résumé généré par Claude — vérifié par l'humain