TY - RPRT TI - Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning AU - Ziyan Wang AU - Zheng Wang AU - Xingwei Qu AU - Qi Cheng AU - Jie Fu AU - Shengpu Tang AU - Minjia Zhang AU - Xiaoming Huo PY - 2026 UR - https://arxiv.org/abs/2510.04072 ID - 2510.04072 ER -