@misc{indiciae99e19d1c05eb, title = {Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers}, author = {Wenhan Ma and Hailin Zhang and Liang Zhao and Yifan Song and Yudong Wang and Zhifang Sui and Fuli Luo}, year = {2025}, url = {https://arxiv.org/abs/2510.11370}, note = {Source identifier: 2510.11370} }