CoRA: Confidence-Rationale Alignment for Reliable Chain-of-Thought Reasoning
Signal
78
Hype
15
En 3 lignesCoRA aligne la confiance du modèle avec la qualité de ses justifications en chaîne de pensée. Un framework RLHF (GRPO) récompense conjointement la correction, la probabilité de réponse et le soutien rationnel via rubrique. Sur MedQA, MathQA, OpenBookQA : réduction de 26,51% de l'erreur d'alignement confiance-rationale.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain