TY - RPRT TI - Accelerating Mixture-of-Experts Inference by Hiding Offloading Latency with Speculative Decoding AU - Zhibin Wang AU - Zhonghui Zhang AU - Yuhang Zhou AU - Zibo Wang AU - Mo Zhou AU - Peng Jiang AU - Weilin Cai AU - Chengying Huan AU - Rong Gu AU - Sheng Zhong AU - Chen Tian PY - 2025 UR - https://arxiv.org/abs/2508.21706 ID - 2508.21706 ER -