paper-with-me

홈 › Papers

CFSum: A Transformer-Based Multi-Modal Video Summarization Framework With Coarse-Fine Fusion

2025-03-01 · Yaowei Guo, Jiazheng Xing, Xiaojun Hou, Shuo Xin, Juntao Jiang, Demetri Terzopoulos, Chenfanfu Jiang, Yong liu

Video summarization, by selecting the most informative and/or user-relevant parts of original videos to create concise summary videos, has high research value and consumer demand in today's video proliferation era. Multi-modal video summarization that accomodates user input has become a research hotspot. However, current multi-modal video summarization methods suffer from two limitations. First, existing methods inadequately fuse information from different modalities and cannot effectively utilize modality-unique features. Second, most multi-modal methods focus on video and text modalities, neglecting the audio modality, despite the fact that audio information can be very useful in certain types of videos. In this paper we propose CFSum, a transformer-based multi-modal video summarization framework with coarse-fine fusion. CFSum exploits video, text, and audio modal features as input, and incorporates a two-stage transformer-based feature fusion framework to fully utilize modality-unique information. In the first stage, multi-modal features are fused simultaneously to perform initial coarse-grained feature fusion, then, in the second stage, video and audio features are explicitly attended with the text representation yielding more fine-grained information interaction. The CFSum architecture gives equal importance to each modality, ensuring that each modal feature interacts deeply with the other modalities. Our extensive comparative experiments against prior methods and ablation studies on various datasets confirm the effectiveness and superiority of CFSum.

📄 PDF Abstract BibTeX arXiv:2503.00364

Code (0)

등록된 구현이 없습니다.

Tasks

Video Summarization

Methods 이 논문이 사용한 방법론

Focus 설명 없음

Similar Papers 제목 키워드 기반

CFSum: A Coarse-to-Fine Contribution Network for Multimodal Summarization

2023-07-06 · Min Xiao, Junnan Zhu, Haitao Lin, Yu Zhou 외

Multimodal summarization usually suffers from the problem that the contribution of the visual modality is unclear. Existing multimodal summarization approaches focus on designing the fusion methods of different modalitie…

Hierarchical Multimodal Transformer to Summarize Videos

2021-09-22 · Bin Zhao, Maoguo Gong, Xuelong Li

Although video summarization has achieved tremendous success benefiting from Recurrent Neural Networks (RNN), RNN-based methods neglect the global dependencies and multi-hop relationships among video frames, which limits…

Machine TranslationSupervised Video SummarizationTranslationVideo Captioning+1

Multimodal Frame-Scoring Transformer for Video Summarization

2022-07-05 · Jeiyoon Park, Kiho Kwoun, Chanhee Lee, Heuiseok Lim

As the number of video content has mushroomed in recent years, automatic video summarization has come useful when we want to just peek at the content of the video. However, there are two underlying limitations in generic…

Video Summarization

GPT2MVS: Generative Pre-trained Transformer-2 for Multi-modal Video Summarization

2021-04-26 · Jia-Hong Huang, Luka Murn, Marta Mrak, Marcel Worring

Traditional video summarization methods generate fixed video representations regardless of user interest. Therefore such methods limit users' expectations in content search and exploration scenarios. Multi-modal video su…

Video Summarization

SITransformer: Shared Information-Guided Transformer for Extreme Multimodal Summarization

2024-08-28 · Sicheng Liu, Lintao Wang, Xiaogang Zhu, Xuequan Lu 외

Extreme Multimodal Summarization with Multimodal Output (XMSMO) becomes an attractive summarization approach by integrating various types of information to create extremely concise yet informative summaries for individua…