TY - RPRT TI - Step-wise Adaptive Integration of Supervised Fine-tuning and Reinforcement Learning for Task-Specific LLMs AU - Jack Chen AU - Fazhong Liu AU - Naruto Liu AU - Yuhan Luo AU - Erqu Qin AU - Harry Zheng AU - Tian Dong AU - Haojin Zhu AU - Yan Meng AU - Xiao Wang PY - 2025 UR - https://arxiv.org/abs/2505.13026 ID - 2505.13026 ER -