Back to feed
arXiv cs.LG·

UNIQ: Conformal Calibration for Adaptive Conservatism in Offline Reinforcement Learning

Signal
78
Hype
15
In three linesUNIQ introduces conformal calibration for adaptive conservatism in offline reinforcement learning. Built on IQL, the method uses a multi-expectile ensemble and split conformal prediction for distribution-free uncertainty estimation, dynamically adjusting penalties based on local data coverage. On D4RL MuJoCo, UNIQ outperforms IQL with 10× lower memory than EDAC.
Read source
Your take?
Reinforcement learningPapersBenchmarksEvals

Summary generated by Claude — human-verified