Augmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?
Article arXiv proposant un cadre formel pour combiner évaluations LLM et humaines. Utilise un estimateur doublement robuste (missing data) pour déterminer le nombre optimal d'évaluations humaines nécessaires en validation de benchmarks, plutôt que de substituer les humains par des LLM.