TY - RPRT TI - Posterior sampling for reinforcement learning: worst-case regret bounds AU - Shipra Agrawal AU - Randy Jia PY - 2020 UR - https://arxiv.org/abs/1705.07041 ID - 1705.07041 ER -