Early-Token Confidence Predicts Reasoning Quality in Multi-Agent LLM Debate
Signal
72
Hype
18
En 3 lignesLes probabilités logarithmiques des premiers tokens générés prédisent mieux la qualité du raisonnement dans les débats multi-agents LLM que les statistiques sur la séquence complète. Testé sur deux ensembles d'essais ASAP avec évaluation par juge LLM, ce signal intrinsèque offre une estimation légère de la fiabilité du raisonnement.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain