@article{litecacheaquerysimilaritydrivengpucentri, title = {LiteCache: A Query Similarity-Driven, GPU-Centric KVCache Subsystem for Efficient LLM Inference}, author = {Jiawei Yi and Ping Gong and Youhui Bai and Zewen Jin and Shengnan Wang and Jiaqi Ruan and Jia He and Jiaan Zhu and Pengcheng Wang and Haibo Wang and Weiguang Wang and Xia Zhu and Cheng Li}, year = {2025}, eprint = {2511.14510}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2511.14510}, }