@article{acceleratingllminferencewithflexiblenm, title = {Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator}, author = {Akshat Ramachandran and Souvik Kundu and Arnab Raha and Shamik Kundu and Deepak K. Mathaikutty and Tushar Krishna}, year = {2025}, eprint = {2504.14365}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2504.14365v1}, }