@article{lserveefficientlongsequencellmserving, title = {LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention}, author = {Shang Yang and Junxian Guo and Haotian Tang and Qinghao Hu and Guangxuan Xiao and Jiaming Tang and Yujun Lin and Zhijian Liu and Yao Lu and Song Han}, year = {2025}, eprint = {2502.14866}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2502.14866v2}, }