TY - RPRT TI - Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning AU - Shuang Chen AU - Yue Guo AU - Zhaochen Su AU - Yafu Li AU - Yulun Wu AU - Jiacheng Chen AU - Jiayu Chen AU - Weijie Wang AU - Xiaoye Qu AU - Yu Cheng PY - 2026 UR - https://arxiv.org/abs/2506.04207 ID - 2506.04207 ER -