Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models
Signal
72
Hype
25
En 3 lignesLes modèles de langage deviennent surconfiants quand on augmente le budget de raisonnement au-delà d'un seuil critique. Ce phénomène, appelé Calibration Drift Under Reasoning (CDUR), est étudié sur Llama-3.1-8B et Llama-3.3-70B. Les auteurs proposent CABStop, une règle d'arrêt calibrée pour arrêter le raisonnement quand la confiance diverge de l'exactitude réelle.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain