TY - RPRT TI - EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training AU - Chengjun Pan AU - Shichun Liu AU - Jiahang Lin AU - Dingwei Zhu AU - Jiazheng Zhang AU - Shihan Dou AU - Songyang Gao AU - Zhenhua Han AU - Binghai Wang AU - Rui Zheng AU - Xuanjing Huang AU - Tao Gui AU - Yansong Feng PY - 2026 UR - https://arxiv.org/abs/2604.19485 ID - 2604.19485 ER -