Retour au feed
arXiv cs.LG·

Lyapunov-Based Sample Complexity Analysis for Weakly-Coupled MDPs

Signal
72
Hype
15
En 3 lignesAnalyse de la complexité d'échantillonnage pour l'apprentissage dans les processus de décision markoviens faiblement couplés (WCMDPs) et les bandits sans repos. Les auteurs montrent que des politiques quasi-optimales peuvent être apprises avec une complexité polynomiale en N (nombre de bras), via une analyse Lyapunov novatrice et une technique de transfert de dérive entre modèles vrais et empiriques.
Lire la source
Ton avis ?
Reinforcement learningBenchmarksPapers

Résumé généré par Claude — vérifié par l'humain