TY - RPRT TI - Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization AU - Yang Bai AU - Kaiyuan Liu AU - Ziyuan Zhuang AU - Jiahong Zhou AU - Rongxiang Weng AU - Xin Chen AU - Jingang Wang AU - Xunliang Cai PY - 2026 UR - https://arxiv.org/abs/2605.13641 ID - 2605.13641 ER -