@article{vtlvlmaravideotemporallargevisionlanguag, title = {VT-LVLM-AR: A Video-Temporal Large Vision-Language Model Adapter for Fine-Grained Action Recognition in Long-Term Videos}, author = {Kaining Li and Shuwei He and Zihan Xu}, year = {2025}, eprint = {2508.15903}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2508.15903}, }