@inproceedings{viltaenhancingvisionlanguagepretraining, title = {ViLTA: Enhancing Vision-Language Pre-training through Textual Augmentation}, author = {Weihan Wang and Zhen Yang and Bin Xu and Juanzi Li and Yankui Sun}, year = {2023}, booktitle = {ICCV 2023 1}, eprint = {2308.16689}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2308.16689v1}, }