@article{videoxumcrossmodalvisualandtextural, title = {VideoXum: Cross-modal Visual and Textural Summarization of Videos}, author = {Jingyang Lin and Hang Hua and Ming Chen and Yikang Li and Jenhao Hsiao and Chiuman Ho and Jiebo Luo}, year = {2023}, eprint = {2303.12060}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2303.12060v3}, }