TY - RPRT TI - Provable Offline Preference-Based Reinforcement Learning AU - Wenhao Zhan AU - Masatoshi Uehara AU - Nathan Kallus AU - Jason D. Lee AU - Wen Sun PY - 2023 UR - https://arxiv.org/abs/2305.14816 ID - 2305.14816 ER -