@article{largelanguagemodelinferenceaccelerationa, title = {Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective}, author = {Jinhao Li and Jiaming Xu and Shan Huang and Yonghua Chen and Wen Li and Jun Liu and Yaoxiu Lian and Jiayi Pan and Li Ding and Hao Zhou and Yu Wang and Guohao Dai}, year = {2024}, eprint = {2410.04466}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2410.04466v4}, }