paper-with-me

Papers

Modeling Motion with Multi-Modal Features for Text-Based Video Segmentation

2022-04-06 · CVPR 2022 1 · Wangbo Zhao, Kai Wang, Xiangxiang Chu, Fuzhao Xue, Xinchao Wang, Yang You

Text-based video segmentation aims to segment the target object in a video based on a describing sentence. Incorporating motion information from optical flow maps with appearance and linguistic modalities is crucial yet has been largely ignored by previous work. In this paper, we design a method to fuse and align appearance, motion, and linguistic features to achieve accurate segmentation. Specifically, we propose a multi-modal video transformer, which can fuse and aggregate multi-modal and temporal features between frames. Furthermore, we design a language-guided feature fusion module to progressively fuse appearance and motion features in each feature level with guidance from linguistic features. Finally, a multi-modal alignment loss is proposed to alleviate the semantic gap between features from different modalities. Extensive experiments on A2D Sentences and J-HMDB Sentences verify the performance and the generalization ability of our method compared to the state-of-the-art methods.

📄 PDF Abstract BibTeX arXiv:2204.02547

Code (1)

wangbo-zhao/2022cvpr-mmmmtbvs 공식 구현 pytorch

Tasks

Optical Flow EstimationReferring Expression SegmentationSegmentationSentenceVideo SegmentationVideo Semantic Segmentation

Methods 이 논문이 사용한 방법론

ALIGN In the ALIGN method, visual and language representations are jointly trained from noisy image alt-text data. The image and text encoders are learned via contrastive loss…

Similar Papers 제목 키워드 기반

SURE: Synergistic Uncertainty-aware Reasoning for Multimodal Emotion Recognition in Conversations

2026-04-02 · Yiqiang Cai, Chengyan Wu, Bolei Ma, Bo Chen 외 arxiv

Multimodal emotion recognition in conversations (MERC) requires integrating multimodal signals while being robust to noise and modeling contextual reasoning. Existing approaches often emphasize fusion but overlook uncert…

Multimodal Emotion RecognitionMultimodal Reasoning

Latent Distribution Decoupling: A Probabilistic Framework for Uncertainty-Aware Multimodal Emotion Recognition

2025-02-19 · Jingwang Huang, Jiang Zhong, Qin Lei, Jinpeng Gao 외

Multimodal multi-label emotion recognition (MMER) aims to identify the concurrent presence of multiple emotions in multimodal data. Existing studies primarily focus on improving fusion strategies and modeling modality-to…

Emotion RecognitionMultimodal Emotion Recognition

AMB-DSGDN: Adaptive Modality-Balanced Dynamic Semantic Graph Differential Network for Multimodal Emotion Recognition

2026-03-07 · Yunsheng Wang, Yuntao Shou, Yilong Tan, Wei Ai 외 arxiv

Multimodal dialogue emotion recognition captures emotional cues by fusing text, visual, and audio modalities. However, existing approaches still suffer from notable limitations in modeling emotional dependencies and lear…

Multimodal Emotion Recognition

EmoLat: Text-driven Image Sentiment Transfer via Emotion Latent Space

2026-01-17 · Jing Zhang, Bingjie Fan, Jixiang Zhu, Zhe Wang arxiv

We propose EmoLat, a novel emotion latent space that enables fine-grained, text-driven image sentiment transfer by modeling cross-modal correlations between textual semantics and visual emotion features. Within EmoLat, a…

Disentangled Dual-Branch Graph Learning for Conversational Emotion Recognition

2026-04-03 · Chengling Guo, Yuntao Shou, Tao Meng, Wei Ai 외 arxiv

Multimodal emotion recognition in conversations aims to infer utterance-level emotions by jointly modeling textual, acoustic, and visual cues within context. Despite recent progress, key challenges remain, including redu…

Multimodal Emotion RecognitionGraph Neural NetworkGraph Learning