TY - RPRT TI - Minimax Regret Bounds for Reinforcement Learning AU - Mohammad Gheshlaghi Azar AU - Ian Osband AU - Rémi Munos PY - 2017 UR - https://arxiv.org/abs/1703.05449 ID - 1703.05449 ER -