@article{structureclipenhancemultimodallanguage, title = {Structure-CLIP: Towards Scene Graph Knowledge to Enhance Multi-modal Structured Representations}, author = {Yufeng Huang and Jiji Tang and Zhuo Chen and Rongsheng Zhang and Xinfeng Zhang and WeiJie Chen and Zeng Zhao and Zhou Zhao and Tangjie Lv and Zhipeng Hu and Wen Zhang}, year = {2023}, eprint = {2305.06152}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2305.06152v3}, }