TY - RPRT TI - To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models AU - Haoqing Wang AU - Xiang Long AU - Ziheng Li AU - Yilong Xu AU - Tingguang Li AU - Yehui Tang PY - 2026 UR - https://arxiv.org/abs/2602.12566 ID - 2602.12566 ER -