@article{packinfercomputeandioefficientattentionf, title = {PackInfer: Compute- and I/O-Efficient Attention for Batched LLM Inference}, author = {Rui Ning and Wei Zhang and Fan Lai}, year = {2026}, eprint = {2602.06072}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2602.06072}, }