Retour au feed
arXiv cs.CL·

The Confident Liar: Diagnosing Multi-Agent Debate with Log-Probabilities and LLM-as-Judge

Signal
72
Hype
15
En 3 lignesÉtude de la relation entre confiance interne (log-probabilités), évaluation externe (LLM-as-judge) et exactitude finale dans les débats multi-agents. Framework avec Constructor et Auditor révèle asymétrie de rôle : la confiance du Constructor prédit 2× mieux la qualité du raisonnement jugé et détecte les défaillances critiques (AUROC 0.804 vs 0.634 pour l'Auditor).
Lire la source
Ton avis ?
Multi-agentsAgents IARaisonnementÉvaluationsPapers

Résumé généré par Claude — vérifié par l'humain