TY - RPRT TI - Posterior Sampling for Reinforcement Learning Without Episodes AU - Ian Osband AU - Benjamin Van Roy PY - 2016 UR - https://arxiv.org/abs/1608.02731 ID - 1608.02731 ER -