@article{videolanguagealignmentpretrainingvia, title = {Video-Language Alignment via Spatio-Temporal Graph Transformer}, author = {Shi-Xue Zhang and Hongfa Wang and Xiaobin Zhu and Weibo Gu and Tianjin Zhang and Chun Yang and Wei Liu and Xu-Cheng Yin}, year = {2024}, eprint = {2407.11677}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2407.11677v2}, }