TY - RPRT TI - DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning AU - Guochao Jiang AU - Jingyi Song AU - Guofeng Quan AU - Chuzhan Hao AU - Guohua Liu AU - Yuewei Zhang PY - 2026 UR - https://arxiv.org/abs/2605.25604 ID - 2605.25604 ER -