Retour au feed
arXiv cs.LG·

Self-CTRL: Self-Consistency Training with Reinforcement Learning

Signal
78
Hype
25
En 3 lignesSelf-CTRL optimise la cohérence entre les auto-explications et le comportement des modèles de langage via apprentissage par renforcement. Sur un task de raisonnement probabiliste, la méthode améliore la corrélation R² de 0.24 à 0.64. En IA constitutionnelle, elle augmente la prédiction des refus de 36% à 92% et réduit le taux d'échec HarmBench de 15.0% à 0.5%.
Lire la source
Ton avis ?
Reinforcement learningAlignementSécurité IAÉvaluations

Résumé généré par Claude — vérifié par l'humain