@article{visionlanaugepretrainingbycontrastive, title = {Vision Language Pre-training by Contrastive Learning with Cross-Modal Similarity Regulation}, author = {Chaoya Jiang and Wei Ye and Haiyang Xu and Miang yan and Shikun Zhang and Jie Zhang and Fei Huang}, year = {2023}, eprint = {2305.04474}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2305.04474v3}, }