@article{mvpenhancingvideolargelanguagemodelsvias, title = {MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction}, author = {Xiaokun Sun and Zezhong Wu and Zewen Ding and Linli Xu}, year = {2026}, eprint = {2601.03781}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2601.03781}, }