Retour au feed
arXiv cs.LG·

Statistically Reliable LLM-Based Ranking Evaluation via Prediction-Powered Inference

Signal
78
Hype
15
En 3 lignesPRECISE étend Prediction-Powered Inference pour évaluer les classements en combinant annotations humaines (30) et jugements LLM (Claude 3 Sonnet). Réduit l'erreur standard de Precision@4 de 4.45 à 3.50 (−21%). En production, identifie correctement le meilleur variant avec 100 labels humains; A/B test confirme +407 bps de ventes.
Lire la source
Ton avis ?
ÉvaluationsClaudeBenchmarksRaisonnement

Résumé généré par Claude — vérifié par l'humain