@article{inferenceperformanceoptimizationforlarge, title = {Inference Performance Optimization for Large Language Models on CPUs}, author = {Pujiang He and Shan Zhou and Wenhuan Huang and Changqing Li and Duyi Wang and Bin Guo and Chen Meng and Sheng Gui and Weifei Yu and Yi Xie}, year = {2024}, eprint = {2407.07304}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2407.07304v1}, }