TY - RPRT TI - Query-Policy Misalignment in Preference-Based Reinforcement Learning AU - Xiao Hu AU - Jianxiong Li AU - Xianyuan Zhan AU - Qing-Shan Jia AU - Ya-Qin Zhang PY - 2024 UR - https://arxiv.org/abs/2305.17400 ID - 2305.17400 ER -