@article{efficientandworkloadawarellmservingvia, title = {Efficient and Workload-Aware LLM Serving via Runtime Layer Swapping and KV Cache Resizing}, author = {Zhaoyuan Su and Tingfeng Lan and ZiRui Wang and Juncheng Yang and Yue Cheng}, year = {2025}, eprint = {2506.02006}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2506.02006v1}, }