@article{revisitlargescaleimagecaptiondatainpre, title = {Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models}, author = {Zhengfeng Lai and Vasileios Saveris and Chen Chen and Hong-You Chen and Haotian Zhang and BoWen Zhang and Juan Lao Tebar and Wenze Hu and Zhe Gan and Peter Grasch and Meng Cao and Yinfei Yang}, year = {2024}, eprint = {2410.02740}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2410.02740v1}, }