TY - RPRT TI - Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning AU - Zhiheng Xi AU - Jixuan Huang AU - Xin Guo AU - Boyang Hong AU - Dingwen Yang AU - Xiaoran Fan AU - Shuo Li AU - Zehui Chen AU - Junjie Ye AU - Siyu Yuan AU - Zhengyin Du AU - Xuesong Yao AU - Yufei Xu AU - Jiecao Chen AU - Rui Zheng AU - Tao Gui AU - Qi Zhang AU - Xuanjing Huang PY - 2025 UR - https://arxiv.org/abs/2510.24320 ID - 2510.24320 ER -