@misc{indiciae3f186dfc4b98, title = {NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference}, author = {Xuanlin Jiang and Yang Zhou and Shiyi Cao and Ion Stoica and Minlan Yu}, year = {2024}, url = {https://arxiv.org/abs/2411.01142}, note = {Source identifier: 2411.01142} }