TY - RPRT TI - Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization AU - Haoran Xu AU - Li Jiang AU - Jianxiong Li AU - Zhuoran Yang AU - Zhaoran Wang AU - Victor Wai Kin Chan AU - Xianyuan Zhan PY - 2023 UR - https://arxiv.org/abs/2303.15810 ID - 2303.15810 ER -