TY - RPRT TI - CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning AU - Congmin Zheng AU - Jiachen Zhu AU - Jianghao Lin AU - Xinyi Dai AU - Weiwen Liu AU - Haoxuan Li AU - Yong Yu AU - Weinan Zhang AU - Mengyue Yang PY - 2026 UR - https://arxiv.org/abs/2507.15698 ID - 2507.15698 ER -