TY - RPRT TI - Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers AU - Wenhan Ma AU - Hailin Zhang AU - Liang Zhao AU - Yifan Song AU - Yudong Wang AU - Zhifang Sui AU - Fuli Luo PY - 2025 UR - https://arxiv.org/abs/2510.11370 ID - 2510.11370 ER -