TY - RPRT TI - Neural Policy Gradient Methods: Global Optimality and Rates of Convergence AU - Lingxiao Wang AU - Qi Cai AU - Zhuoran Yang AU - Zhaoran Wang PY - 2019 UR - https://arxiv.org/abs/1909.01150 ID - 1909.01150 ER -