TY - RPRT TI - Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL AU - Songjun Tu AU - Jiahao Lin AU - Qichao Zhang AU - Xiangyu Tian AU - Linjing Li AU - Xiangyuan Lan AU - Dongbin Zhao PY - 2025 UR - https://arxiv.org/abs/2505.10832 ID - 2505.10832 ER -