@article{acceleratingllminferencethroughputvia, title = {Accelerating LLM Inference Throughput via Asynchronous KV Cache Prefetching}, author = {Yanhao Dong and Yubo Miao and Weinan Li and Xiao Zheng and Chao Wang and Feng Lyu}, year = {2025}, eprint = {2504.06319}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2504.06319v1}, }