TY - RPRT TI - Revisiting Policy Gradients for Restricted Policy Classes: Escaping Myopic Local Optima with $k$-step Policy Gradients AU - Alex DeWeese AU - Guannan Qu PY - 2026 UR - https://arxiv.org/abs/2605.10909 ID - 2605.10909 ER -