TY - RPRT TI - Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence AU - Wenhao Zhan AU - Shicong Cen AU - Baihe Huang AU - Yuxin Chen AU - Jason D. Lee AU - Yuejie Chi PY - 2023 UR - https://arxiv.org/abs/2105.11066 ID - 2105.11066 ER -