TY - RPRT TI - R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging AU - Yanlin Lai AU - Mitt Huang AU - Hangyu Guo AU - Xiangfeng Wang AU - Haodong Li AU - Shaoxiong Zhan AU - Liang Zhao AU - Chengyuan Yao AU - Yinmin Zhang AU - Qi Han AU - Chun Yuan AU - Zheng Ge AU - Xiangyu Zhang AU - Daxin Jiang PY - 2026 UR - https://arxiv.org/abs/2602.06763 ID - 2602.06763 ER -