@misc{indiciae188aceb57287, title = {Task Scheduling for Efficient Inference of Large Language Models on Single Moderate GPU Systems}, author = {Wenxiang Lin and Xinglin Pan and Shaohuai Shi and Xuan Wang and Xiaowen Chu}, year = {2024}, url = {https://arxiv.org/abs/2411.15715}, note = {Source identifier: 2411.15715} }