Robust Domain Generalization for Multi-modal Object Recognition
In multi-label classification, machine learning encounters the challenge of domain generalization when handling tasks with distributions differing from the training data. Existing approaches primarily focus on vision object recognition and neglect the integration of natural language. Recent advancements in vision-language pre-training leverage supervision from extensive visual-language pairs, enabling learning across diverse domains and enhancing recognition in multi-modal scenarios. However, these approaches face limitations in loss function utilization, generality across backbones, and class-aware visual fusion. This paper proposes solutions to these limitations by inferring the actual loss, broadening evaluations to larger vision-language backbones, and introducing Mixup-CLIPood, which incorporates a novel mix-up loss for enhanced class-aware visual fusion. Our method demonstrates superior performance in domain generalization across multiple datasets.
Code (0)
등록된 구현이 없습니다.
Tasks
Domain GeneralizationMulti-Label ClassificationMUlTI-LABEL-ClASSIFICATIONObjectObject RecognitionMethods 이 논문이 사용한 방법론
Similar Papers 제목 키워드 기반
Integrating Audio Narrations to Strengthen Domain Generalization in Multimodal First-Person Action Recognition
First-person activity recognition is rapidly growing due to the widespread use of wearable cameras but faces challenges from domain shifts across different environments, such as varying objects or background scenes. We p…
Action RecognitionActivity RecognitionDomain GeneralizationUF-AMA: A unified framework for cross-domain emotion recognition via adaptive multimodal alignment
In recent years, emotion recognition based on physiological signals such as electroencephalogram (EEG) has gained considerable attention, as internal physiological data offer greater objectivity and reliability compared …
Multimodal Emotion RecognitionDomain AdaptationModality-Agnostic Debiasing for Single Domain Generalization
Deep neural networks (DNNs) usually fail to generalize well to outside of distribution (OOD) data, especially in the extreme case of single domain generalization (single-DG) that transfers DNNs from single domain to mult…
Data AugmentationDomain GeneralizationSemantic SegmentationAdvances in Multimodal Adaptation and Generalization: From Traditional Approaches to Foundation Models
In real-world scenarios, achieving domain adaptation and generalization poses significant challenges, as models must adapt to or generalize across unknown target distributions. Extending these capabilities to unseen mult…
Action RecognitionDomain AdaptationDomain GeneralizationSemantic Segmentation+1Domain-robust VQA with diverse datasets and methods but no target labels
The observation that computer vision methods overfit to dataset specifics has inspired diverse attempts to make object recognition models robust to domain shifts. However, similar work on domain-robust visual question an…
Domain AdaptationObject RecognitionQuestion AnsweringUnsupervised Domain Adaptation+2