@article{tipsv2advancingvisionlanguagepretraining, title = {TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment}, author = {Bingyi Cao and Koert Chen and Kevis-Kokitsi Maninis and Kaifeng Chen and Arjun Karpur and Ye Xia and Sahil Dua and Tanmaya Dabral and Guangxing Han and Bohyung Han and Joshua Ainslie and Alex Bewley and Mithun Jacob and René Wagner and Washington Ramos and Krzysztof Choromanski and Mojtaba Seyedhosseini and Howard Zhou and André Araujo}, year = {2026}, eprint = {2604.12012}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2604.12012}, }