TY - RPRT TI - RPO:Reinforcement Fine-Tuning with Partial Reasoning Optimization AU - Hongzhu Yi AU - Xinming Wang AU - Zhenghao zhang AU - Tianyu Zong AU - Yuanxiang Wang AU - Jun Xie AU - Tao Yu AU - Haopeng Jin AU - Kaixin Xu AU - Feng Chen AU - Jiahuan Chen AU - Yujia Yang AU - Zhenyu Guan AU - Bingkang Shi AU - Jungang Xu PY - 2026 UR - https://arxiv.org/abs/2601.19404 ID - 2601.19404 ER -