Retour au feed
arXiv cs.LG·

Performance Variation in Deep Reinforcement Learning

Signal
72
Hype
15
En 3 lignesÉtude sur la variabilité des performances en apprentissage par renforcement profond. Les auteurs critiquent les méthodes conventionnelles de mesure d'incertitude et proposent des statistiques basées sur les percentiles (min-max IPR). Trois cas d'étude : LayerNorm réduit la variation dans PPO mais pas SAC ; TD-MPC2 montre moins de variation que PPO/SAC ; DQN et Rainbow présentent une variabilité similaire sur Atari.
Lire la source
Ton avis ?
Reinforcement learningBenchmarksÉvaluations

Résumé généré par Claude — vérifié par l'humain