TY - RPRT TI - Libra: Assessing and Improving Reward Model by Learning to Think AU - Meng Zhou AU - Bei Li AU - Jiahao Liu AU - Xiaowen Shi AU - Yang Bai AU - Rongxiang Weng AU - Jingang Wang AU - Xunliang Cai PY - 2025 UR - https://arxiv.org/abs/2507.21645 ID - 2507.21645 ER -