TY - RPRT TI - SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation AU - Wen Wang AU - Jiahua Bao AU - Tu Yongsiqi AU - Yihao Liu AU - Haotian Zhou AU - Haoxuan Ma AU - Mengyu Zhou AU - Wenkui Fan AU - Junwei He AU - Xiaoxi Jiang AU - Guanjun Jiang PY - 2026 UR - https://arxiv.org/abs/2608.03092 ID - 2608.03092 ER -