TY - RPRT TI - Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards AU - Zixun Huang AU - Jiayi Sheng AU - Zeyu Zheng PY - 2026 UR - https://arxiv.org/abs/2511.23310 ID - 2511.23310 ER -