TY - RPRT TI - Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models AU - Ilgee Hong AU - Changlong Yu AU - Liang Qiu AU - Weixiang Yan AU - Zhenghao Xu AU - Haoming Jiang AU - Qingru Zhang AU - Qin Lu AU - Xin Liu AU - Chao Zhang AU - Tuo Zhao PY - 2025 UR - https://arxiv.org/abs/2505.16265 ID - 2505.16265 ER -