TY - RPRT TI - First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training AU - Lai Wei AU - Yuting Li AU - Chen Wang AU - Yue Wang AU - Linghe Kong AU - Weiran Huang AU - Lichao Sun PY - 2025 UR - https://arxiv.org/abs/2505.22453 ID - 2505.22453 ER -