@article{nomadattentionefficientllminferenceon, title = {NoMAD-Attention: Efficient LLM Inference on CPUs Through Multiply-add-free Attention}, author = {Tianyi Zhang and Jonah Wonkyu Yi and Bowen Yao and Zhaozhuo Xu and Anshumali Shrivastava}, year = {2024}, eprint = {2403.01273}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2403.01273v1}, }