TY - RPRT TI - Evolving LLMs' Self-Refinement Capability via Synergistic Training-Inference Optimization AU - Yongcheng Zeng AU - Xinyu Cui AU - Xuanfa Jin AU - Qirui Mi AU - Guoqing Liu AU - Zexu Sun AU - Mengyue Yang AU - Dong Li AU - Weiyu Ma AU - Ning Yang AU - Jian Zhao AU - Jianye Hao AU - Haifeng Zhang AU - Jun Wang PY - 2025 UR - https://arxiv.org/abs/2502.05605 ID - 2502.05605 ER -