@article{losslessaccelerationoflargelanguagemodel, title = {Lossless Acceleration of Large Language Model via Adaptive N-gram Parallel Decoding}, author = {Jie Ou and Yueming Chen and Wenhong Tian}, year = {2024}, eprint = {2404.08698}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2404.08698v2}, }