@misc{indiciaedadbb7b37796, title = {DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning}, author = {Guochao Jiang and Jingyi Song and Guofeng Quan and Chuzhan Hao and Guohua Liu and Yuewei Zhang}, year = {2026}, url = {https://arxiv.org/abs/2605.25604}, note = {Source identifier: 2605.25604} }