@article{acceleratinglargescalereasoningmodelinfe, title = {Accelerating Large-Scale Reasoning Model Inference with Sparse Self-Speculative Decoding}, author = {Yilong Zhao and Jiaming Tang and Kan Zhu and Zihao Ye and Chi-Chih Chang and Chaofan Lin and Jongseok Park and Guangxuan Xiao and Mohamed S. Abdelfattah and Mingyu Gao and Baris Kasikci and Song Han and Ion Stoica}, year = {2025}, eprint = {2512.01278}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2512.01278}, }