@misc{indiciae32888cd58c23, title = {CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning}, author = {Ziqi Jia and Yalu Ouyang and Bo Pang and Panpan Li and Hangfei Xu and Shengzhao Wen and Shiyong Li and Yanpeng Wang}, year = {2026}, url = {https://arxiv.org/abs/2608.03068}, note = {Source identifier: 2608.03068} }