TY - RPRT TI - Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models AU - Shidong Yang AU - Tongwen Huang AU - Hao Wen AU - Yong Wang AU - Li Chen AU - Xiangxiang Chu PY - 2026 UR - https://arxiv.org/abs/2602.01884 ID - 2602.01884 ER -