TY - RPRT TI - Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models AU - Shilin Xu AU - Yanwei Li AU - Rui Yang AU - Tao Zhang AU - Yueyi Sun AU - Wei Chow AU - Linfeng Li AU - Hang Song AU - Qi Xu AU - Yunhai Tong AU - Xiangtai Li AU - Hao Fei PY - 2025 UR - https://arxiv.org/abs/2505.24164 ID - 2505.24164 ER -