Retour au feed
arXiv cs.CL·

CoRA: Confidence-Rationale Alignment for Reliable Chain-of-Thought Reasoning

Signal
78
Hype
15
En 3 lignesCoRA aligne la confiance du modèle avec la qualité de ses justifications en chaîne de pensée. Un framework RLHF (GRPO) récompense conjointement la correction, la probabilité de réponse et le soutien rationnel via rubrique. Sur MedQA, MathQA, OpenBookQA : réduction de 26,51% de l'erreur d'alignement confiance-rationale.
Lire la source
Ton avis ?
RaisonnementReinforcement learningÉvaluationsAlignement

Résumé généré par Claude — vérifié par l'humain