TY - RPRT TI - GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning AU - Chenglong Wang AU - Yongyu Mu AU - Hang Zhou AU - Yifu Huo AU - Ziming Zhu AU - Jiali Zeng AU - Murun Yang AU - Bei Li AU - Xiaoyang Hao AU - Chunliang Zhang AU - Fandong Meng AU - Jingbo Zhu AU - Tong Xiao PY - 2025 UR - https://arxiv.org/abs/2509.02492 ID - 2509.02492 ER -