@article{towardsefficientlargelanguagemodelservin, title = {Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization}, author = {Jiantong Jiang and Peiyu Yang and Rui Zhang and Feng Liu}, year = {2026}, eprint = {2607.08057}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2607.08057}, }