TY - RPRT TI - GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization AU - Shih-Yang Liu AU - Xin Dong AU - Ximing Lu AU - Shizhe Diao AU - Peter Belcak AU - Mingjie Liu AU - Min-Hung Chen AU - Hongxu Yin AU - Yu-Chiang Frank Wang AU - Kwang-Ting Cheng AU - Yejin Choi AU - Jan Kautz AU - Pavlo Molchanov PY - 2026 UR - https://arxiv.org/abs/2601.05242 ID - 2601.05242 ER -