@article{compresskvsemanticretrievalguidedkvcache, title = {CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference}, author = {Xiaolin Lin and Jingcun Wang and Olga Kondrateva and Yiyu Shi and Bing Li and Grace Li Zhang}, year = {2026}, eprint = {2606.24467}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2606.24467}, }