TY - RPRT TI - Why is Posterior Sampling Better than Optimism for Reinforcement Learning? AU - Ian Osband AU - Benjamin Van Roy PY - 2017 UR - https://arxiv.org/abs/1607.00215 ID - 1607.00215 ER -