@misc{indiciaef3fe06c3e2f6, title = {Model Compression and Efficient Inference for Large Language Models: A Survey}, author = {Wenxiao Wang and Wei Chen and Yicong Luo and Yongliu Long and Zhengkai Lin and Liye Zhang and Binbin Lin and Deng Cai and Xiaofei He}, year = {2024}, url = {https://arxiv.org/abs/2402.09748}, note = {Source identifier: 2402.09748} }