@article{240721757, title = {Learning Video Context as Interleaved Multimodal Sequences}, author = {Kevin Qinghong Lin and Pengchuan Zhang and Difei Gao and Xide Xia and Joya Chen and Ziteng Gao and Jinheng Xie and Xuhong Xiao and Mike Zheng Shou}, year = {2024}, eprint = {2407.21757}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2407.21757v2}, }