The Confident Liar: Diagnosing Multi-Agent Debate with Log-Probabilities and LLM-as-Judge
Signal
72
Hype
15
En 3 lignesÉtude de la relation entre confiance interne (log-probabilités), évaluation externe (LLM-as-judge) et exactitude finale dans les débats multi-agents. Framework avec Constructor et Auditor révèle asymétrie de rôle : la confiance du Constructor prédit 2× mieux la qualité du raisonnement jugé et détecte les défaillances critiques (AUROC 0.804 vs 0.634 pour l'Auditor).Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain