paper-with-me

Papers

MSMO: Multimodal Summarization with Multimodal Output

2018-10-01 · EMNLP 2018 10 · Junnan Zhu, Haoran Li, Tianshang Liu, Yu Zhou, Jiajun Zhang, Cheng-qing Zong

Multimodal summarization has drawn much attention due to the rapid growth of multimedia data. The output of the current multimodal summarization systems is usually represented in texts. However, we have found through experiments that multimodal output can significantly improve user satisfaction for informativeness of summaries. In this paper, we propose a novel task, multimodal summarization with multimodal output (MSMO). To handle this task, we first collect a large-scale dataset for MSMO research. We then propose a multimodal attention model to jointly generate text and select the most relevant image from the multimodal input. Finally, to evaluate multimodal outputs, we construct a novel multimodal automatic evaluation (MMAE) method which considers both intra-modality salience and inter-modality relevance. The experimental results show the effectiveness of MMAE.

📄 PDF Abstract BibTeX

Code (0)

등록된 구현이 없습니다.

Tasks

InformativenessText Summarization

Similar Papers 제목 키워드 기반

Leveraging Entity Information for Cross-Modality Correlation Learning: The Entity-Guided Multimodal Summarization

2024-08-06 · Yanghai Zhang, Ye Liu, Shiwei Wu, Kai Zhang 외

The rapid increase in multimedia data has spurred advancements in Multimodal Summarization with Multimodal Output (MSMO), which aims to produce a multimodal summary that integrates both text and relevant images. The inhe…

Knowledge DistillationLanguage ModelingLanguage Modelling

Hierarchical Cross-Modality Semantic Correlation Learning Model for Multimodal Summarization

2021-12-16 · Litian Zhang, XiaoMing Zhang, Junshu Pan, Feiran Huang

Multimodal summarization with multimodal output (MSMO) generates a summary with both textual and visual content. Multimodal news report contains heterogeneous contents, which makes MSMO nontrivial. Moreover, it is observ…

Diversity

SITransformer: Shared Information-Guided Transformer for Extreme Multimodal Summarization

2024-08-28 · Sicheng Liu, Lintao Wang, Xiaogang Zhu, Xuequan Lu 외

Extreme Multimodal Summarization with Multimodal Output (XMSMO) becomes an attractive summarization approach by integrating various types of information to create extremely concise yet informative summaries for individua…

MMSum: A Dataset for Multimodal Summarization and Thumbnail Generation of Videos

2023-06-07 · CVPR 2024 1 · JieLin Qiu, Jiacheng Zhu, William Han, Aditesh Kumar 외

Multimodal summarization with multimodal output (MSMO) has emerged as a promising research direction. Nonetheless, numerous limitations exist within existing public MSMO datasets, including insufficient maintenance, data…

Text SummarizationVideo Summarization

VMSMO: Learning to Generate Multimodal Summary for Video-based News Articles

2020-10-12 · EMNLP 2020 11 · Mingzhe Li, Xiuying Chen, Shen Gao, Zhangming Chan 외

A popular multimedia news format nowadays is providing users with a lively video and a corresponding news article, which is employed by influential news media including CNN, BBC, and social media including Twitter and We…

Articles