TY - RPRT TI - Regularizing a Model-based Policy Stationary Distribution to Stabilize Offline Reinforcement Learning AU - Shentao Yang AU - Yihao Feng AU - Shujian Zhang AU - Mingyuan Zhou PY - 2022 UR - https://arxiv.org/abs/2206.07166 ID - 2206.07166 ER -