@article{evilmefficientvideolanguagemodelvia, title = {E-ViLM: Efficient Video-Language Model via Masked Video Modeling with Semantic Vector-Quantized Tokenizer}, author = {Jacob Zhiyuan Fang and Skyler Zheng and Vasu Sharma and Robinson Piramuthu}, year = {2023}, eprint = {2311.17267}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2311.17267v1}, }