TY - RPRT TI - Dueling Posterior Sampling for Preference-Based Reinforcement Learning AU - Ellen R. Novoseller AU - Yibing Wei AU - Yanan Sui AU - Yisong Yue AU - Joel W. Burdick PY - 2020 UR - https://arxiv.org/abs/1908.01289 ID - 1908.01289 ER -