@article{230609085v1, title = {COSA: Concatenated Sample Pretrained Vision-Language Foundation Model}, author = {Sihan Chen and Xingjian He and Handong Li and Xiaojie Jin and Jiashi Feng and Jing Liu}, year = {2023}, eprint = {2306.09085}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2306.09085v1}, }