paper-with-me

홈 › Papers

MM-AVS: A Full-Scale Dataset for Multi-modal Summarization

2021-06-01 · NAACL 2021 4 · Xiyan Fu, Jun Wang, Zhenglu Yang

Multimodal summarization becomes increasingly significant as it is the basis for question answering, Web search, and many other downstream tasks. However, its learning materials have been lacking a holistic organization by integrating resources from various modalities, thereby lagging behind the research progress of this field. In this study, we release a full-scale multimodal dataset comprehensively gathering documents, summaries, images, captions, videos, audios, transcripts, and titles in English from CNN and Daily Mail. To our best knowledge, this is the first collection that spans all modalities and nearly comprises all types of materials available in this community. In addition, we devise a baseline model based on the novel dataset, which employs a newly proposed Jump-Attention mechanism based on transcripts. The experimental results validate the important assistance role of the external information for multimodal summarization.

📄 PDF Abstract BibTeX

Code (0)

등록된 구현이 없습니다.

Tasks

Question Answering

Similar Papers 제목 키워드 기반

SD-MVSum: Script-Driven Multimodal Video Summarization Method and Datasets

2025-10-07 · Manolis Mylonas, Charalampia Zerva, Evlampios Apostolidis, Vasileios Mezaris arxiv

In this work, we present a method and two large-scale datasets for Script-Driven Multimodal Video Summarization. The proposed method, SD-MVSum, builds on our earlier SD-VSum method for script-driven video summarization, …

Semantic SimilarityVideo Summarization

Large Scale Multi-Lingual Multi-Modal Summarization Dataset

2023-02-13 · Yash Verma, Anubhav Jangra, Raghvendra Kumar, Sriparna Saha

Significant developments in techniques such as encoder-decoder models have enabled us to represent information comprising multiple modalities. This information can further enhance many downstream tasks in the field of in…

ArticlesDecoderDiversityInformation Retrieval+2

Align and Attend: Multimodal Summarization with Dual Contrastive Losses

2023-03-13 · CVPR 2023 1 · Bo He, Jun Wang, JieLin Qiu, Trung Bui 외

The goal of multimodal summarization is to extract the most important information from different modalities to form output summaries. Unlike the unimodal summarization, the multimodal summarization task explicitly levera…

Extractive Text SummarizationSupervised Video SummarizationVideo Summarization

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

2026-03-01 · Sumin Kim, Hyemin Jeong, Mingu Kang, Yejin Kim 외 arxiv

The exponential growth of video content necessitates effective video summarization to efficiently extract key information from long videos. However, current approaches struggle to fully comprehend complex videos, primari…

Video Summarization

Hierarchical3D Adapters for Long Video-to-text Summarization

2022-10-10 · Pinelopi Papalampidi, Mirella Lapata

In this paper, we focus on video-to-text summarization and investigate how to best utilize multimodal information for summarizing long inputs (e.g., an hour-long TV show) into long outputs (e.g., a multi-sentence summary…

SentenceText Summarization