TY - RPRT TI - Memory Offloading for Large Language Model Inference with Latency SLO Guarantees AU - Chenxiang Ma AU - Zhisheng Ye AU - Hanyu Zhao AU - Zehua Yang AU - Tianhao Fu AU - Jiaxun Han AU - Jie Zhang AU - Yingwei Luo AU - Xiaolin Wang AU - Zhenlin Wang AU - Yong Li AU - Diyu Zhou PY - 2025 UR - https://arxiv.org/abs/2502.08182 ID - 2502.08182 ER -