@misc{indiciae17dcc302c2bb, title = {A Reduction-Based Framework for Conservative Bandits and Reinforcement Learning}, author = {Yunchang Yang and Tianhao Wu and Han Zhong and Evrard Garcelon and Matteo Pirotta and Alessandro Lazaric and Liwei Wang and Simon S. Du}, year = {2022}, url = {https://arxiv.org/abs/2106.11692}, note = {Source identifier: 2106.11692} }