TY - RPRT TI - CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning AU - Ziqi Jia AU - Yalu Ouyang AU - Bo Pang AU - Panpan Li AU - Hangfei Xu AU - Shengzhao Wen AU - Shiyong Li AU - Yanpeng Wang PY - 2026 UR - https://arxiv.org/abs/2608.03068 ID - 2608.03068 ER -