@article{evaacceleratingllmdecodingviaanefficient, title = {EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture}, author = {Bowen Duan and Cong Guo and Chiyue Wei and Haoxuan Shan and Yuzhe Fu and Xinhua Chen and Yifan Xu and Ziyue Zhang and Changchun Zhou and Hai Li and Yiran Chen}, year = {2026}, eprint = {2605.24144}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.24144}, }