@misc{indiciaebbe263213664, title = {Accelerating Mixture-of-Experts Inference by Hiding Offloading Latency with Speculative Decoding}, author = {Zhibin Wang and Zhonghui Zhang and Yuhang Zhou and Zibo Wang and Mo Zhou and Peng Jiang and Weilin Cai and Chengying Huan and Rong Gu and Sheng Zhong and Chen Tian}, year = {2025}, url = {https://arxiv.org/abs/2508.21706}, note = {Source identifier: 2508.21706} }