TY - RPRT TI - Near-optimal Reinforcement Learning in Factored MDPs AU - Ian Osband AU - Benjamin Van Roy PY - 2014 UR - https://arxiv.org/abs/1403.3741 ID - 1403.3741 ER -