@article{gstepglobalspatiotemporaldensitydrivenvi, title = {GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models}, author = {Mengjie Zhang and Qihui Zhu and Tao Zhang and Shuangwu Chen and Huihuang Qin and Yu Guo and Shenghao Ye and Zijian Wen and Yunpeng Hou and Dong Jin and Xiaobin Tan and Huasen He and Jian Yang}, year = {2026}, eprint = {2608.03083}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2608.03083}, }