paper-with-me

Papers Multimodal Intent Recognition

“Multimodal Intent Recognition” 태그가 달린 논문 22편 · 필터 해제

Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition

2026-08-04 · Suraj Kumar, Mohnish Raj, Soumi Chattopadhayay, Chandranath Adak 외 arxiv

Multimodal intent recognition combines linguistic, acoustic, and visual evidence, but individual modalities may be noisy, missing, semantically conflicting, or disproportionately dominant. Existing methods typically infe…

Multimodal Intent Recognition

Tri-Subspaces Disentanglement for Multimodal Sentiment Analysis

2026-02-23 · Chunlei Meng, Jiabin Luo, Zhenglin Yan, Zhenyu Yu 외 arxiv

Multimodal Sentiment Analysis (MSA) integrates language, visual, and acoustic modalities to infer human sentiment. Most existing methods either focus on globally shared representations or modality-specific features, whil…

Multimodal Intent RecognitionMultimodal Sentiment Analysis

MVCL-DAF++: Enhancing Multimodal Intent Recognition via Prototype-Aware Contrastive Alignment and Coarse-to-Fine Dynamic Attention Fusion

2025-09-22 · Haofeng Huang, Yifei Han, Long Zhang, Bin Li 외 arxiv

Multimodal intent recognition (MMIR) suffers from weak semantic grounding and poor robustness under noisy or rare-class conditions. We propose MVCL-DAF++, which extends MVCL-DAF with two key modules: (1) Prototype-aware …

Multimodal Intent Recognition

DyKen-Hyena: Dynamic Kernel Generation via Cross-Modal Attention for Multimodal Intent Recognition

2025-09-12 · Yifei Wang, Wenbin Wang, Yong Luo arxiv

Though Multimodal Intent Recognition (MIR) proves effective by utilizing rich information from multiple sources (e.g., language, video, and audio), the potential for intent-irrelevant and conflicting information across m…

Multimodal Intent Recognition

LLM-Guided Semantic Relational Reasoning for Multimodal Intent Recognition

2025-09-01 · Qianrui Zhou, Hua Xu, Yifan Wang, Xinzhi Dong 외 arxiv

Understanding human intents from multimodal signals is critical for analyzing human behaviors and enhancing human-machine interactions in real-world scenarios. However, existing methods exhibit limitations in their modal…

Multimodal Intent RecognitionRelational Reasoning

Deep Learning Approaches for Multimodal Intent Recognition: A Survey

2025-07-24 · Jingwei Zhao, Yuhua Wen, Qifei Li, Minchi Hu 외 arxiv

Intent recognition aims to identify users' underlying intentions, traditionally focusing on text in natural language processing. With growing demands for natural human-computer interaction, the field has evolved through …

Multimodal Intent Recognition

WDMIR: Wavelet-Driven Multimodal Intent Recognition

2025-05-27 · Weiyin Gong, Kai Zhang, Yanghai Zhang, Qi Liu 외

Multimodal intent recognition (MIR) seeks to accurately interpret user intentions by integrating verbal and non-verbal information across video, audio and text modalities. While existing approaches prioritize text analys…

Intent RecognitionMultimodal Intent Recognition

A-MESS: Anchor based Multimodal Embedding with Semantic Synchronization for Multimodal Intent Recognition

2025-03-25 · Yaomin Shen, Xiaojian Lin, Wei Fan

In the domain of multimodal intent recognition (MIR), the objective is to recognize human intent by integrating a variety of modalities, such as language text, body gestures, and tones. However, existing approaches face …

Contrastive LearningIntent RecognitionLanguage ModelingLanguage Modelling+3

EMOE: Modality-Specific Enhanced Dynamic Emotion Experts

2025-01-01 · CVPR 2025 1 · Yiyang Fang, Wenke Huang, Guancheng Wan, Kehua Su 외

Multimodal Emotion Recognition (MER) aims to predict human emotions by leveraging multiple modalities, such as vision, acoustics, and language. However, due to the heterogeneity of these modalities, MER faces two key…

Emotion RecognitionIntent RecognitionMultimodal Emotion RecognitionMultimodal Intent Recognition

TECO: Improving Multimodal Intent Recognition with Text Enhancement through Commonsense Knowledge Extraction

2024-12-11 · Quynh-Mai Thi Nguyen, Lan-Nhi Thi Nguyen, Cam-Van Thi Nguyen

The objective of multimodal intent recognition (MIR) is to leverage various modalities-such as text, video, and audio-to detect user intentions, which is crucial for understanding human language and context in dialogue s…

Intent RecognitionMultimodal Intent Recognition

MIntRec2.0: A Large-scale Benchmark Dataset for Multimodal Intent Recognition and Out-of-scope Detection in Conversations

2024-03-16 · Hanlei Zhang, Xin Wang, Hua Xu, Qianrui Zhou 외

Multimodal intent recognition poses significant challenges, requiring the incorporation of non-verbal modalities from real-world contexts to enhance the comprehension of human intentions. Existing benchmark datasets are …

Intent RecognitionMultimodal Intent Recognition

Contextual Augmented Global Contrast for Multimodal Intent Recognition

2024-01-01 · CVPR 2024 1 · Kaili Sun, Zhiwen Xie, Mang Ye, Huyin Zhang

Multimodal intent recognition (MIR) aims to perceive the human intent polarity via language visual and acoustic modalities. The inherent intent ambiguity makes it challenging to recognize in multimodal scenarios. Exi…

Contrastive LearningIntent RecognitionMultimodal Intent RecognitionMultimodal Sentiment Analysis+2

Token-Level Contrastive Learning with Modality-Aware Prompting for Multimodal Intent Recognition

2023-12-22 · Qianrui Zhou, Hua Xu, Hao Li, Hanlei Zhang 외

Multimodal intent recognition aims to leverage diverse modalities such as expressions, body movements and tone of speech to comprehend user's intent, constituting a critical task for understanding human language and beha…

Contrastive LearningIntent RecognitionMultimodal Intent RecognitionPrompt Learning

PaCE: Unified Multi-modal Dialogue Pre-training with Progressive and Compositional Experts

2023-05-24 · Yunshui Li, Binyuan Hui, Zhichao Yin, Min Yang 외

Perceiving multi-modal information and fulfilling dialogues with humans is a long-term goal of artificial intelligence. Pre-training is commonly regarded as an effective approach for multi-modal dialogue. However, due to…

Dialogue State TrackingImage RetrievalMultimodal Intent RecognitionResponse Generation+2

Speech-Text Dialog Pre-training for Spoken Dialog Understanding with Explicit Cross-Modal Alignment

2023-05-19 · Tianshu Yu, Haoyu Gao, Ting-En Lin, Min Yang 외

Recently, speech-text pre-training methods have shown remarkable success in many speech and natural language processing tasks. However, most previous pre-trained models are usually tailored for one or two specific tasks,…

cross-modal alignmentEmotion Recognition in ConversationMultimodal Intent RecognitionMultimodal Sentiment Analysis

MMDialog: A Large-scale Multi-turn Dialogue Dataset Towards Multi-modal Open-domain Conversation

2022-11-10 · Jiazhan Feng, Qingfeng Sun, Can Xu, Pu Zhao 외

Responding with multi-modal content has been recognized as an essential capability for an intelligent conversational agent. In this paper, we introduce the MMDialog dataset to better facilitate multi-modal conversation. …

Multimodal Intent RecognitionRetrieval

MIntRec: A New Dataset for Multimodal Intent Recognition

2022-09-09 · Hanlei Zhang, Hua Xu, Xin Wang, Qianrui Zhou 외

Multimodal intent recognition is a significant task for understanding human language in real-world multimodal scenes. Most existing intent recognition methods have limitations in leveraging the multimodal information due…

Intent RecognitionMultimodal Intent Recognition

0/1 Deep Neural Networks via Block Coordinate Descent

2022-06-19 · HUI ZHANG, Shenglong Zhou, Geoffrey Ye Li, Naihua Xiu

The step function is one of the simplest and most natural activation functions for deep neural networks (DNNs). As it counts 1 for positive variables and 0 for others, its intrinsic characteristics (e.g., discontinuity a…

10-shot image generation16k2D Object Detection+92

ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision

2021-02-05 · Wonjae Kim, Bokyung Son, Ildoo Kim

Vision-and-Language Pre-training (VLP) has improved performance on various joint vision-and-language downstream tasks. Current approaches to VLP heavily rely on image feature extraction processes, most of which involve r…

Cross-Modal RetrievalImage RetrievalMultimodal Intent Recognitionmultimodal interaction+4

Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

2019-10-23 · arXiv 2019 10 · Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee 외

Transfer learning, where a model is first pre-trained on a data-rich task before being fine-tuned on a downstream task, has emerged as a powerful technique in natural language processing (NLP). The effectiveness of trans…

Answer GenerationCommon Sense ReasoningCoreference ResolutionDiversity+12
1–20 / 22 다음 →