TY - RPRT TI - DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling AU - Zhihong Zhang AU - Jie Zhao AU - Xiaojian Huang AU - Jin Xu AU - Zhuodong Luo AU - Xin Liu AU - Jiansheng Wei AU - Xuejin Chen PY - 2026 UR - https://arxiv.org/abs/2604.19544 ID - 2604.19544 ER -