TY - RPRT TI - Inference Performance Optimization for Large Language Models on CPUs AU - Pujiang He AU - Shan Zhou AU - Wenhuan Huang AU - Changqing Li AU - Duyi Wang AU - Bin Guo AU - Chen Meng AU - Sheng Gui AU - Weifei Yu AU - Yi Xie PY - 2024 UR - https://arxiv.org/abs/2407.07304 ID - 2407.07304 ER -