Retour au feed
arXiv cs.LG·

UNIQ: Conformal Calibration for Adaptive Conservatism in Offline Reinforcement Learning

Signal
78
Hype
15
En 3 lignesUNIQ introduit une calibration conforme pour adapter la conservatisme dans l'apprentissage par renforcement hors ligne. Basé sur IQL, la méthode utilise un ensemble multi-expectile et la prédiction conforme pour estimer l'incertitude sans distribution, ajustant dynamiquement la pénalité selon la couverture locale des données. Sur D4RL MuJoCo, UNIQ surpasse IQL avec 10× moins de mémoire qu'EDAC.
Lire la source
Ton avis ?
Reinforcement learningPapersBenchmarksÉvaluations

Résumé généré par Claude — vérifié par l'humain