TY - RPRT TI - Model-Based Reinforcement Learning with a Generative Model is Minimax Optimal AU - Alekh Agarwal AU - Sham Kakade AU - Lin F. Yang PY - 2020 UR - https://arxiv.org/abs/1906.03804 ID - 1906.03804 ER -