@article{towardseffectivelongvideounderstandingof, title = {Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval}, author = {Tao Chen and Shaobo Ju and Qiong Wu and Chenxin Fang and Kun Zhang and Jun Peng and Hui Li and Yiyi Zhou and Rongrong Ji}, year = {2025}, eprint = {2512.08410}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2512.08410}, }