@inproceedings{svitttemporallearningofsparsevideotext, title = {SViTT: Temporal Learning of Sparse Video-Text Transformers}, author = {Yi Li and Kyle Min and Subarna Tripathi and Nuno Vasconcelos}, year = {2023}, booktitle = {CVPR 2023 1}, eprint = {2304.08809}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2304.08809v1}, }