paper-with-me

Papers

VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?

2024-11-17 · CVPR 2025 1 · Yunlong Tang, Junjia Guo, Hang Hua, Susan Liang, Mingqian Feng, Xinyang Li, Rui Mao, Chao Huang, Jing Bi, Zeliang Zhang, Pooyan Fazli, Chenliang Xu

The advancement of Multimodal Large Language Models (MLLMs) has enabled significant progress in multimodal understanding, expanding their capacity to analyze video content. However, existing evaluation benchmarks for MLLMs primarily focus on abstract video comprehension, lacking a detailed assessment of their ability to understand video compositions, the nuanced interpretation of how visual elements combine and interact within highly compiled video contexts. We introduce VidComposition, a new benchmark specifically designed to evaluate the video composition understanding capabilities of MLLMs using carefully curated compiled videos and cinematic-level annotations. VidComposition includes 982 videos with 1706 multiple-choice questions, covering various compositional aspects such as camera movement, angle, shot size, narrative structure, character actions and emotions, etc. Our comprehensive evaluation of 33 open-source and proprietary MLLMs reveals a significant performance gap between human and model capabilities. This highlights the limitations of current MLLMs in understanding complex, compiled video compositions and offers insights into areas for further improvement. The leaderboard and evaluation code are available at https://yunlong10.github.io/VidComposition/.

📄 PDF Abstract BibTeX arXiv:2411.10979

Code (2)

yunlong10/MMPerspective
yunlong10/VidComposition

Tasks

Multiple-choice

Methods 이 논문이 사용한 방법론

Focus 설명 없음

Similar Papers 제목 키워드 기반

RO-Bench: Large-scale robustness evaluation of MLLMs with text-driven counterfactual videos

2025-10-10 · Zixi Yang, Jiapeng Li, Muxi Diao, Yinuo Jing 외 arxiv

Recently, Multi-modal Large Language Models (MLLMs) have demonstrated significant performance across various video understanding tasks. However, their robustness, particularly when faced with manipulated video content, r…

MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos

2024-06-12 · Xuehai He, Weixi Feng, Kaizhi Zheng, Yujie Lu 외

Multimodal Language Language Models (MLLMs) demonstrate the emerging abilities of "world models" -- interpreting and reasoning about complex real-world dynamics. To assess these abilities, we posit videos are the ideal m…

counterfactualFuture predictionVideo Understanding

Enhancing Compositional Reasoning in Vision-Language Models with Synthetic Preference Data

2025-04-07 · Samarth Mishra, Kate Saenko, Venkatesh Saligrama

Compositionality, or correctly recognizing scenes as compositions of atomic visual concepts, remains difficult for multimodal large language models (MLLMs). Even state of the art MLLMs such as GPT-4o can make mistakes in…

Question AnsweringVisual Question Answering

Colon-Bench: An Agentic Workflow for Scalable Dense Lesion Annotation in Full-Procedure Colonoscopy Videos

2026-03-26 · Abdullah Hamdi, Changchun Yang, Xin Gao arxiv

Early screening via colonoscopy is critical for colon cancer prevention, yet developing robust AI systems for this domain is hindered by the lack of densely annotated, long-sequence video datasets. Existing datasets pred…

Video Object SegmentationVisual Question Answering

VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos

2025-05-29 · Tingyu Song, Tongyan Hu, Guo Gan, Yilun Zhao

MLLMs have been widely studied for video question answering recently. However, most existing assessments focus on natural videos, overlooking synthetic videos, such as AI-generated content (AIGC). Meanwhile, some works i…

Question AnsweringVideo GenerationVideo Question Answering