TY - RPRT TI - Policy Mirror Descent for Reinforcement Learning: Linear Convergence, New Sampling Complexity, and Generalized Problem Classes AU - Guanghui Lan PY - 2022 UR - https://arxiv.org/abs/2102.00135 ID - 2102.00135 ER -