@article{leveragingvisionlanguagelargemodelsforin, title = {Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization}, author = {Jingwei Peng and Zhixuan Qiu and Boyu Jin and Surasakdi Siripong}, year = {2025}, eprint = {2509.05695}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2509.05695}, }