TY - RPRT TI - In-Dataset Trajectory Return Regularization for Offline Preference-based Reinforcement Learning AU - Songjun Tu AU - Jingbo Sun AU - Qichao Zhang AU - Yaocheng Zhang AU - Jia Liu AU - Ke Chen AU - Dongbin Zhao PY - 2024 UR - https://arxiv.org/abs/2412.09104 ID - 2412.09104 ER -