TY - RPRT TI - On Optimistic versus Randomized Exploration in Reinforcement Learning AU - Ian Osband AU - Benjamin Van Roy PY - 2017 UR - https://arxiv.org/abs/1706.04241 ID - 1706.04241 ER -