@article{efficientvisionandlanguagepretraining, title = {Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection}, author = {Wei Ye and Chaoya Jiang and Haiyang Xu and Chenhao Ye and Chenliang Li and Ming Yan and Shikun Zhang and Songhang Huang and Fei Huang}, year = {2024}, eprint = {2403.07883}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2403.07883v1}, }