TY - RPRT TI - Hindsight Preference Learning for Offline Preference-based Reinforcement Learning AU - Chen-Xiao Gao AU - Shengjun Fang AU - Chenjun Xiao AU - Yang Yu AU - Zongzhang Zhang PY - 2024 UR - https://arxiv.org/abs/2407.04451 ID - 2407.04451 ER -