TY - RPRT TI - Nearly Minimax Optimal Reinforcement Learning for Linear Mixture Markov Decision Processes AU - Dongruo Zhou AU - Quanquan Gu AU - Csaba Szepesvari PY - 2021 UR - https://arxiv.org/abs/2012.08507 ID - 2012.08507 ER -