@article{cfsumatransformerbasedmultimodalvideo, title = {CFSum: A Transformer-Based Multi-Modal Video Summarization Framework With Coarse-Fine Fusion}, author = {Yaowei Guo and Jiazheng Xing and Xiaojun Hou and Shuo Xin and Juntao Jiang and Demetri Terzopoulos and Chenfanfu Jiang and Yong liu}, year = {2025}, eprint = {2503.00364}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2503.00364v1}, }