TY - RPRT TI - A Reduction-Based Framework for Conservative Bandits and Reinforcement Learning AU - Yunchang Yang AU - Tianhao Wu AU - Han Zhong AU - Evrard Garcelon AU - Matteo Pirotta AU - Alessandro Lazaric AU - Liwei Wang AU - Simon S. Du PY - 2022 UR - https://arxiv.org/abs/2106.11692 ID - 2106.11692 ER -