@article{loongserveefficientlyservinglongcontext, title = {LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism}, author = {Bingyang Wu and Shengyu Liu and Yinmin Zhong and Peng Sun and Xuanzhe Liu and Xin Jin}, year = {2024}, eprint = {2404.09526}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2404.09526v2}, }