TY - RPRT TI - Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning AU - Zhihao Dou AU - Qinjian Zhao AU - Zhongwei Wan AU - Dinggen Zhang AU - Weida Wang AU - Towsif Raiyan AU - Benteng Chen AU - Qingtao Pan AU - Yang Ouyang AU - Chaoda Song AU - Zhiqiang Gao AU - Shufei Zhang AU - Sumon Biswas PY - 2026 UR - https://arxiv.org/abs/2510.01833 ID - 2510.01833 ER -