@article{structxlipenhancingvisionlanguagemodelsw, title = {StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues}, author = {Zanxi Ruan and Songqun Gao and Qiuyu Kong and Yiming Wang and Marco Cristani}, year = {2026}, eprint = {2602.20089}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2602.20089}, }