@misc{indiciae4d0eaf46ad82, title = {Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management}, author = {Liu Qianli and Hong Zicong and Chen Fahao and Li Peng and Guo Song}, year = {2025}, url = {https://arxiv.org/abs/2501.06709}, note = {Source identifier: 2501.06709} }