TY - RPRT TI - Conditional Advantage Estimation for Reinforcement Learning in Large Reasoning Models AU - Guanxu Chen AU - Yafu Li AU - Yuxian Jiang AU - Chen Qian AU - Qihan Ren AU - Jingyi Yang AU - Yu Cheng AU - Dongrui Liu AU - Jing Shao PY - 2025 UR - https://arxiv.org/abs/2509.23962 ID - 2509.23962 ER -