Exact Unlearning in Reinforcement Learning
Signal
75
Hype
15
En 3 lignesArticle théorique sur l'oubli exact en apprentissage par renforcement. Les auteurs proposent un algorithme RL ρ-TV-stable permettant de supprimer les données d'un utilisateur avec un coût computationnel de ρ√ln T fois celui du réentraînement. Regret borné en O(H²√SAT + H³S²A + H^2.5S²A/ρ) pour MDPs tabulaires, avec borne inférieure quasi-optimale.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain