@article{lazyllmdynamictokenpruningforefficient, title = {LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference}, author = {Qichen Fu and Minsik Cho and Thomas Merth and Sachin Mehta and Mohammad Rastegari and Mahyar Najibi}, year = {2024}, eprint = {2407.14057}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2407.14057v1}, }