@article{retrievalattentionacceleratinglongcontex, title = {RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval}, author = {Di Liu and Meng Chen and Baotong Lu and Huiqiang Jiang and Zhenhua Han and Qianxi Zhang and Qi Chen and Chengruidong Zhang and Bailu Ding and Kai Zhang and Chen Chen and Fan Yang and Yuqing Yang and Lili Qiu}, year = {2024}, eprint = {2409.10516}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2409.10516v3}, }