@misc{indiciae8fbf32eb469b, title = {LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism}, author = {Bingyang Wu and Shengyu Liu and Yinmin Zhong and Peng Sun and Xuanzhe Liu and Xin Jin}, year = {2024}, url = {https://arxiv.org/abs/2404.09526}, note = {Source identifier: 2404.09526} }