@misc{indiciae30e28c610829, title = {Memory Offloading for Large Language Model Inference with Latency SLO Guarantees}, author = {Chenxiang Ma and Zhisheng Ye and Hanyu Zhao and Zehua Yang and Tianhao Fu and Jiaxun Han and Jie Zhang and Yingwei Luo and Xiaolin Wang and Zhenlin Wang and Yong Li and Diyu Zhou}, year = {2025}, url = {https://arxiv.org/abs/2502.08182}, note = {Source identifier: 2502.08182} }