@article{minference10acceleratingprefillingfor, title = {MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention}, author = {Huiqiang Jiang and Yucheng Li and Chengruidong Zhang and Qianhui Wu and Xufang Luo and Surin Ahn and Zhenhua Han and Amir H. Abdi and Dongsheng Li and Chin-Yew Lin and Yuqing Yang and Lili Qiu}, year = {2024}, eprint = {2407.02490}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2407.02490v2}, }