TY - RPRT TI - Provable Benefits of Policy Learning from Human Preferences in Contextual Bandit Problems AU - Xiang Ji AU - Huazheng Wang AU - Minshuo Chen AU - Tuo Zhao AU - Mengdi Wang PY - 2023 UR - https://arxiv.org/abs/2307.12975 ID - 2307.12975 ER -