TY - RPRT TI - R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning AU - Yi-Fan Zhang AU - Xingyu Lu AU - Xiao Hu AU - Chaoyou Fu AU - Bin Wen AU - Tianke Zhang AU - Changyi Liu AU - Kaiyu Jiang AU - Kaibing Chen AU - Kaiyu Tang AU - Haojie Ding AU - Jiankang Chen AU - Fan Yang AU - Zhang Zhang AU - Tingting Gao AU - Liang Wang PY - 2025 UR - https://arxiv.org/abs/2505.02835 ID - 2505.02835 ER -