TY - RPRT TI - Learning to Reason as Action Abstractions with Scalable Mid-Training RL AU - Shenao Zhang AU - Donghan Yu AU - Yihao Feng AU - Bowen Jin AU - Zhaoran Wang AU - John Peebles AU - Zirui Wang PY - 2025 UR - https://arxiv.org/abs/2509.25810 ID - 2509.25810 ER -