TY - RPRT TI - A Greedy Approximation of Bayesian Reinforcement Learning with Probably Optimistic Transition Model AU - Kenji Kawaguchi AU - Mauricio Araya PY - 2013 UR - https://arxiv.org/abs/1303.3163 ID - 1303.3163 ER -