paper-with-me

홈 › Papers

Enhancing Multimodal Emotion Recognition via Multi-Feature Encoding and Attention-Based Fusion

2026-09-04 · Xu Lin, Ke Wang, Hui Kang, Xinying Wang arxiv

Multimodal emotion recognition has attracted growing interest due to its importance in human-computer interaction, remote education, and healthcare. This paper proposes a novel multimodal emotion recognition framework that integrates rich audio and visual feature extraction with an attention-based fusion strategy. For audio, we extract three complementary feature types: semantic embeddings from Wav2Vec2, MFCC features, and statistical acoustic descriptors such as pitch, energy, and rhythm. These are aligned and fused via a BiLSTM to capture temporal dependencies. For video, we propose a ResNet50-BiLSTM architecture that combines deep residual learning and sequential modeling to extract expressive spatiotemporal features from facial sequences. To enhance multimodal synergy, we introduce a feature-level fusion mechanism based on multi-head attention, allowing the model to adaptively weigh contributions across modalities. Experiments conducted on the MELD and IEMOCAP datasets demonstrate that our model significantly outperforms baselines in both accuracy and robustness. Furthermore, ablation studies show that the attention-based fusion strategy significantly improves performance in unbalanced data settings. Our findings suggest that the proposed framework effectively captures diverse emotional cues from speech and visual expressions, and offers a practical and generalizable approach for real-world multimodal emotion recognition tasks.

📄 PDF Abstract BibTeX arXiv:2609.04690

Code (2)

Tavish9/awesome-daily-AI-arxiv ★ 114
arxivsub/arXivSub_daily_arxiv ★ 4

Tasks

Multimodal Emotion Recognition

Similar Papers 제목 키워드 기반

Noise-Resistant Multimodal Transformer for Emotion Recognition

2023-05-04 · Yuanyuan Liu, Haoyu Zhang, Yibing Zhan, Zijing Chen 외

Multimodal emotion recognition identifies human emotions from various data modalities like video, text, and audio. However, we found that this task can be easily affected by noisy information that does not contain useful…

Emotion RecognitionMultimodal Emotion Recognition

Dynamic Fusion-Aware Graph Convolutional Neural Network for Multimodal Emotion Recognition in Conversations

2026-03-22 · Tao Meng, Weilun Tang, Yuntao Shou, Yilong Tan 외 arxiv

Multimodal emotion recognition in conversations (MERC) aims to identify and understand the emotions expressed by speakers during utterance interaction from multiple modalities (e.g., text, audio, images, etc.). Existing …

Multimodal Emotion RecognitionEmotion Classification

MGHFT: Multi-Granularity Hierarchical Fusion Transformer for Cross-Modal Sticker Emotion Recognition

2025-07-25 · Jian Chen, Yuxuan Hu, Haifeng Lu, Wei Wang 외 arxiv

Although pre-trained visual models with text have demonstrated strong capabilities in visual feature extraction, sticker emotion understanding remains challenging due to its reliance on multi-view information, such as ba…

Contrastive LearningEmotion Recognition

TiCAL:Typicality-Based Consistency-Aware Learning for Multimodal Emotion Recognition

2025-11-19 · Wen Yin, Siyu Zhan, Cencen Liu, Xin Hu 외 arxiv

Multimodal Emotion Recognition (MER) aims to accurately identify human emotional states by integrating heterogeneous modalities such as visual, auditory, and textual data. Existing approaches predominantly rely on unifie…

Multimodal Emotion Recognition

Enhancing Multimodal Emotion Recognition through Multi-Granularity Cross-Modal Alignment

2024-12-30 · Xuechen Wang, Shiwan Zhao, Haoqin Sun, Hui Wang 외

Multimodal emotion recognition (MER), leveraging speech and text, has emerged as a pivotal domain within human-computer interaction, demanding sophisticated methods for effective multimodal integration. The challenge of …

cross-modal alignmentEmotion RecognitionMultimodal Emotion Recognition