@misc{indiciaedfd396b1c988, title = {Distributed Inference Performance Optimization for LLMs on CPUs}, author = {Pujiang He and Shan Zhou and Changqing Li and Wenhuan Huang and Weifei Yu and Duyi Wang and Chen Meng and Sheng Gui}, year = {2024}, url = {https://arxiv.org/abs/2407.00029}, note = {Source identifier: 2407.00029} }