State commitment learning: training language models to distinguish computation from memory
Signal
78
Hype
15
En 3 lignesNouvelle méthode d'entraînement pour distinguer le calcul temporaire de l'état persistant dans les modèles de langage. Counterfactual Erasure RL (CERL) récompense les modèles quand la réponse reste correcte après suppression des pensées intermédiaires. Évaluation sur mathématiques, logique et QA scientifique montre réduction de la dépendance aux calculs cachés sans perte de précision.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain