@article{promptdistillquerybasedselectivetoken, title = {PromptDistill: Query-based Selective Token Retention in Intermediate Layers for Efficient Large Language Model Inference}, author = {Weisheng Jin and Maojia Song and Tej Deep Pala and Yew Ken Chia and Amir Zadeh and Chuan Li and Soujanya Poria}, year = {2025}, eprint = {2503.23274}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2503.23274v1}, }