Retour au feed
arXiv cs.CL·

Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

Signal
78
Hype
15
En 3 lignesReRULE améliore l'oubli non-supervisé des LLM en utilisant un replay hors-politique pour les cas difficiles. La méthode stocke les rollouts bas-récompense près de la frontière forget/retain dans un buffer et les réutilise via des mises à jour importance-sampled. Sur MUSE-Books, elle augmente la Retain Quality de 46.3 à 56.2 avec +5-11% de temps d'entraînement.
Lire la source
Ton avis ?
Reinforcement learningSécurité IAAlignementPapers

Résumé généré par Claude — vérifié par l'humain