TY - RPRT TI - Towards Stable and Effective Reinforcement Learning for Mixture-of-Experts AU - Di Zhang AU - Xun Wu AU - Shaohan Huang AU - Lingjie Jiang AU - Yaru Hao AU - Li Dong AU - Zewen Chi AU - Zhifang Sui AU - Furu Wei PY - 2026 UR - https://arxiv.org/abs/2510.23027 ID - 2510.23027 ER -