TY - RPRT TI - Reward-Consistent Dynamics Models are Strongly Generalizable for Offline Reinforcement Learning AU - Fan-Ming Luo AU - Tian Xu AU - Xingchen Cao AU - Yang Yu PY - 2023 UR - https://arxiv.org/abs/2310.05422 ID - 2310.05422 ER -