TY - RPRT TI - Efficient Preference-based Reinforcement Learning via Aligned Experience Estimation AU - Fengshuo Bai AU - Rui Zhao AU - Hongming Zhang AU - Sijia Cui AU - Ying Wen AU - Yaodong Yang AU - Bo Xu AU - Lei Han PY - 2024 UR - https://arxiv.org/abs/2405.18688 ID - 2405.18688 ER -