@article{adecodingaccelerationframeworkfor, title = {Efficiency Unleashed: Inference Acceleration for LLM-based Recommender Systems with Speculative Decoding}, author = {Yunjia Xi and Hangyu Wang and Bo Chen and Jianghao Lin and Menghui Zhu and Weiwen Liu and Ruiming Tang and Zhewei Wei and Weinan Zhang and Yong Yu}, year = {2024}, eprint = {2408.05676}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2408.05676v2}, }