TY - RPRT TI - VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training AU - Dingwei Zhu AU - Shihan Dou AU - Zhiheng Xi AU - Senjie Jin AU - Guoqiang Zhang AU - Jiazheng Zhang AU - Junjie Ye AU - Mingxu Chai AU - Enyu Zhou AU - Ming Zhang AU - Yuhui Wang AU - Caishuang Huang AU - Chenhao Huang AU - Yunke Zhang AU - Yuran Wang AU - Tao Gui AU - Qi Zhang AU - Xipeng Qiu AU - Xuanjing Huang PY - 2026 UR - https://arxiv.org/abs/2508.03058 ID - 2508.03058 ER -