@article{visionmodelpretrainingoninterleaved, title = {Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning}, author = {Chenyu Yang and Xizhou Zhu and Jinguo Zhu and Weijie Su and Junjie Wang and Xuan Dong and Wenhai Wang and Lewei Lu and Bin Li and Jie zhou and Yu Qiao and Jifeng Dai}, year = {2024}, eprint = {2406.07543}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2406.07543v2}, }