TY - RPRT TI - MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning AU - Chenglong Wang AU - Yifu Huo AU - Yang Gan AU - Qiaozhi He AU - Qi Meng AU - Bei Li AU - Yan Wang AU - Junfu Liu AU - Tianhua Zhou AU - Jingbo Zhu AU - Tong Xiao PY - 2026 UR - https://arxiv.org/abs/2603.25108 ID - 2603.25108 ER -