Retour au feed
arXiv cs.LG·

State commitment learning: training language models to distinguish computation from memory

Signal
78
Hype
15
En 3 lignesNouvelle méthode d'entraînement pour distinguer le calcul temporaire de l'état persistant dans les modèles de langage. Counterfactual Erasure RL (CERL) récompense les modèles quand la réponse reste correcte après suppression des pensées intermédiaires. Évaluation sur mathématiques, logique et QA scientifique montre réduction de la dépendance aux calculs cachés sans perte de précision.
Lire la source
Ton avis ?
RaisonnementReinforcement learningPapers

Résumé généré par Claude — vérifié par l'humain