@misc{indiciaeb876fddcc1d4, title = {Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning}, author = {Yibin Wang and Zhimin Li and Yuhang Zang and Chunyu Wang and Qinglin Lu and Cheng Jin and Jiaqi Wang}, year = {2025}, url = {https://arxiv.org/abs/2505.03318}, note = {Source identifier: 2505.03318} }