@article{anefficientsparseinferencesoftware, title = {An Efficient Sparse Inference Software Accelerator for Transformer-based Language Models on CPUs}, author = {Haihao Shen and Hengyu Meng and Bo Dong and Zhe Wang and Ofir Zafrir and Yi Ding and Yu Luo and Hanwen Chang and Qun Gao and Ziheng Wang and Guy Boudoukh and Moshe Wasserblat}, year = {2023}, eprint = {2306.16601}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2306.16601v1}, }