TY - RPRT TI - Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective AU - Siwei Wang AU - Yifei Shen AU - Haoran Sun AU - Shi Feng AU - Shang-Hua Teng AU - Li Dong AU - Yaru Hao AU - Wei Chen PY - 2026 UR - https://arxiv.org/abs/2509.22613 ID - 2509.22613 ER -