UNIQ: Conformal Calibration for Adaptive Conservatism in Offline Reinforcement Learning
Signal
78
Hype
15
En 3 lignesUNIQ introduit une calibration conforme pour adapter la conservatisme dans l'apprentissage par renforcement hors ligne. Basé sur IQL, la méthode utilise un ensemble multi-expectile et la prédiction conforme pour estimer l'incertitude sans distribution, ajustant dynamiquement la pénalité selon la couverture locale des données. Sur D4RL MuJoCo, UNIQ surpasse IQL avec 10× moins de mémoire qu'EDAC.Lire la source
Ton avis ?
Résumé généré par Claude — vérifié par l'humain