@misc{indiciaeb9223b489767, title = {Scalable Training of Mixture-of-Experts Models with Megatron Core}, author = {Zijie Yan and Hongxiao Bai and Xin Yao and Dennis Liu and Tong Liu and Hongbin Liu and Pingtian Li and Evan Wu and Shiqing Fan and Li Tao and Robin Zhang and Yuzhong Wang and Shifang Xu and Jack Chang and Xuwen Chen and Kunlun Li and Yan Bai and Gao Deng and Nan Zheng and Vijay Anand Korthikanti and Abhinav Khattar and Ethan He and Soham Govande and Sangkug Lym and Zhongbo Zhu and Qi Zhang and Haochen Yuan and Xiaowei Ren and Deyu Fu and Tailai Ma and Shunkang Zhang and Jiang Shao and Ray Wang and Vasudevan Rengasamy and Rachit Garg and Santosh Bhavani and Xipeng Li and Chandler Zhou and David Wu and Yingcan Wei and Ashwath Aithal and Michael Andersch and Mohammad Shoeybi and Jiajie Yao and June Yang}, year = {2026}, url = {https://arxiv.org/abs/2603.07685}, note = {Source identifier: 2603.07685} }