Retour au feed
arXiv cs.CL·

Early-Token Confidence Predicts Reasoning Quality in Multi-Agent LLM Debate

Signal
72
Hype
18
En 3 lignesLes probabilités logarithmiques des premiers tokens générés prédisent mieux la qualité du raisonnement dans les débats multi-agents LLM que les statistiques sur la séquence complète. Testé sur deux ensembles d'essais ASAP avec évaluation par juge LLM, ce signal intrinsèque offre une estimation légère de la fiabilité du raisonnement.
Lire la source
Ton avis ?
Multi-agentsRaisonnementÉvaluations

Résumé généré par Claude — vérifié par l'humain