TY - RPRT TI - Joint Reward Modeling: Internalizing Chain-of-Thought for Efficient Visual Reward Models AU - Yankai Yang AU - Yancheng Long AU - Hongyang Wei AU - Wei Chen AU - Tianke Zhang AU - Kaiyu Jiang AU - Haonan Fan AU - Changyi Liu AU - Jiankang Chen AU - Kaiyu Tang AU - Bin Wen AU - Fan Yang AU - Tingting Gao AU - Han Li AU - Shuo Yang PY - 2026 UR - https://arxiv.org/abs/2602.07533 ID - 2602.07533 ER -