paper-with-me

홈 › Papers

Robust Domain Generalization for Multi-modal Object Recognition

2024-08-11 · Yuxin Qiao, Keqin Li, Junhong Lin, Rong Wei, Chufeng Jiang, Yang Luo, HaoYu Yang

In multi-label classification, machine learning encounters the challenge of domain generalization when handling tasks with distributions differing from the training data. Existing approaches primarily focus on vision object recognition and neglect the integration of natural language. Recent advancements in vision-language pre-training leverage supervision from extensive visual-language pairs, enabling learning across diverse domains and enhancing recognition in multi-modal scenarios. However, these approaches face limitations in loss function utilization, generality across backbones, and class-aware visual fusion. This paper proposes solutions to these limitations by inferring the actual loss, broadening evaluations to larger vision-language backbones, and introducing Mixup-CLIPood, which incorporates a novel mix-up loss for enhanced class-aware visual fusion. Our method demonstrates superior performance in domain generalization across multiple datasets.

📄 PDF Abstract BibTeX arXiv:2408.05831

Code (0)

등록된 구현이 없습니다.

Tasks

Domain GeneralizationMulti-Label ClassificationMUlTI-LABEL-ClASSIFICATIONObjectObject Recognition

Methods 이 논문이 사용한 방법론

Focus 설명 없음

Similar Papers 제목 키워드 기반

Integrating Audio Narrations to Strengthen Domain Generalization in Multimodal First-Person Action Recognition

2024-09-15 · Cagri Gungor, Adriana Kovashka

First-person activity recognition is rapidly growing due to the widespread use of wearable cameras but faces challenges from domain shifts across different environments, such as varying objects or background scenes. We p…

Action RecognitionActivity RecognitionDomain Generalization

UF-AMA: A unified framework for cross-domain emotion recognition via adaptive multimodal alignment

2026-05-29 · Zheng Wang, Shuo Wang, Junhong Wang arxiv

In recent years, emotion recognition based on physiological signals such as electroencephalogram (EEG) has gained considerable attention, as internal physiological data offer greater objectivity and reliability compared …

Multimodal Emotion RecognitionDomain Adaptation

Modality-Agnostic Debiasing for Single Domain Generalization

2023-03-13 · CVPR 2023 1 · Sanqing Qu, Yingwei Pan, Guang Chen, Ting Yao 외

Deep neural networks (DNNs) usually fail to generalize well to outside of distribution (OOD) data, especially in the extreme case of single domain generalization (single-DG) that transfers DNNs from single domain to mult…

Data AugmentationDomain GeneralizationSemantic Segmentation

Advances in Multimodal Adaptation and Generalization: From Traditional Approaches to Foundation Models

2025-01-30 · Hao Dong, Moru Liu, Kaiyang Zhou, Eleni Chatzi 외

In real-world scenarios, achieving domain adaptation and generalization poses significant challenges, as models must adapt to or generalize across unknown target distributions. Extending these capabilities to unseen mult…

Action RecognitionDomain AdaptationDomain GeneralizationSemantic Segmentation+1

Domain-robust VQA with diverse datasets and methods but no target labels

2021-03-29 · CVPR 2021 1 · Mingda Zhang, Tristan Maidment, Ahmad Diab, Adriana Kovashka 외

The observation that computer vision methods overfit to dataset specifics has inspired diverse attempts to make object recognition models robust to domain shifts. However, similar work on domain-robust visual question an…

Domain AdaptationObject RecognitionQuestion AnsweringUnsupervised Domain Adaptation+2