@misc{indiciae31eb3de8e18b, title = {Taming Latency-Memory Trade-Off in MoE-Based LLM Serving via Fine-Grained Expert Offloading}, author = {Hanfei Yu and Xingqi Cui and Hong Zhang and Hao Wang}, year = {2025}, url = {https://arxiv.org/abs/2502.05370}, note = {Source identifier: 2502.05370} }