TY - RPRT TI - Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models AU - Binghai Wang AU - Yantao Liu AU - Yuxuan Liu AU - Tianyi Tang AU - Shenzhi Wang AU - Chang Gao AU - Chujie Zheng AU - Yichang Zhang AU - Le Yu AU - Shixuan Liu AU - Tao Gui AU - Qi Zhang AU - Xuanjing Huang AU - Bowen Yu AU - Fei Huang AU - Junyang Lin PY - 2026 UR - https://arxiv.org/abs/2602.04649 ID - 2602.04649 ER -