@article{draftverifylosslesslargelanguagemodel, title = {Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding}, author = {Jun Zhang and Jue Wang and Huan Li and Lidan Shou and Ke Chen and Gang Chen and Sharad Mehrotra}, year = {2023}, eprint = {2309.08168}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2309.08168v2}, }