@article{rositaenhancingvisionandlanguagesemantic, title = {ROSITA: Enhancing Vision-and-Language Semantic Alignments via Cross- and Intra-modal Knowledge Integration}, author = {Yuhao Cui and Zhou Yu and Chunqi Wang and Zhongzhou Zhao and Ji Zhang and Meng Wang and Jun Yu}, year = {2021}, eprint = {2108.07073}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2108.07073v1}, }