TY - RPRT TI - Learning is planning: near Bayes-optimal reinforcement learning via Monte-Carlo tree search AU - John Asmuth AU - Michael L. Littman PY - 2012 UR - https://arxiv.org/abs/1202.3699 ID - 1202.3699 ER -