paper-with-me

Papers

M&M: Multimodal-Multitask Model Integrating Audiovisual Cues in Cognitive Load Assessment

2024-03-14 · Long Nguyen-Phuoc, Renald Gaboriau, Dimitri Delacroix, Laurent Navarro

This paper introduces the M&M model, a novel multimodal-multitask learning framework, applied to the AVCAffe dataset for cognitive load assessment (CLA). M&M uniquely integrates audiovisual cues through a dual-pathway architecture, featuring specialized streams for audio and video inputs. A key innovation lies in its cross-modality multihead attention mechanism, fusing the different modalities for synchronized multitasking. Another notable feature is the model's three specialized branches, each tailored to a specific cognitive load label, enabling nuanced, task-specific analysis. While it shows modest performance compared to the AVCAffe's single-task baseline, M\&M demonstrates a promising framework for integrated multimodal processing. This work paves the way for future enhancements in multimodal-multitask learning systems, emphasizing the fusion of diverse data types for complex task handling.

📄 PDF Abstract BibTeX arXiv:2403.09451

Code (0)

등록된 구현이 없습니다.

Similar Papers 제목 키워드 기반

Beyond the Mouth: Upper-Face Affective Cues in Audiovisual Sentence Recognition under Acoustic Uncertainty

2026-05-30 · Zhou Yang, Yueyi Yang arxiv

Face-to-face speech comprehension is inherently multimodal, integrating acoustic signals with visible articulation, facial expression, head motion, and other socially relevant cues. While audiovisual speech systems typic…

Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation

2025-07-30 · Kaining Ying, Henghui Ding, Guangquan Jie, Yu-Gang Jiang arxiv

Referring audio-visual segmentation (RAVS) has recently seen significant advancements, yet challenges remain in integrating multimodal information and deeply understanding and reasoning about audiovisual content. To exte…

Multimodal Reasoning

Multitask Learning and Multistage Fusion for Dimensional Audiovisual Emotion Recognition

2020-02-26 · ICASSP 2020 4 · Bagus Tris Atmaja, Masato Akagi

Due to its ability to accurately predict emotional state using multimodal features, audiovisual emotion recognition has recently gained more interest from researchers. This paper proposes two methods to predict emotional…

AttributeEmotion Recognition

A virtual reality-based method for examining audiovisual prosody perception

2022-09-13 · Hartmut Meister, Isa Samira Winter, Moritz Waeachtler, Pascale Sandmann 외

Prosody plays a vital role in verbal communication. Acoustic cues of prosody have been examined extensively. However, prosodic characteristics are not only perceived auditorily, but also visually based on head and facial…

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

2026-02-04 · Ashutosh Chaubey, Jiacheng Pang, Maksim Siniukov, Mohammad Soleymani arxiv

Emotion understanding is essential for building socially intelligent agents. Although recent multimodal large language models have shown strong performance on this task, two key challenges remain - spurious associations …