TY - RPRT TI - Reinforcement Learning for Markovian Bandits: Is Posterior Sampling more Scalable than Optimism? AU - Nicolas Gast AU - Bruno Gaujal AU - Kimang Khun PY - 2022 UR - https://arxiv.org/abs/2106.08771 ID - 2106.08771 ER -