paper-with-me

홈 › Papers

Leveraging Audio-Visual Data to Reduce the Multilingual Gap in Self-Supervised Speech Models

2025-09-22 · María Andrea Cruz Blandón, Zakaria Aldeneh, Jie Chi, Maureen de Seyssel arxiv

Self-supervised learning (SSL) has made significant advances in speech representation learning. Models like wav2vec 2.0 and HuBERT have achieved state-of-the-art results in tasks such as speech recognition, particularly in monolingual settings. However, multilingual SSL models tend to underperform their monolingual counterparts on each individual language, especially in multilingual scenarios with few languages such as the bilingual setting. In this work, we investigate a novel approach to reduce this performance gap by introducing limited visual grounding into bilingual speech SSL models. Our results show that visual grounding benefits both monolingual and bilingual models, with especially pronounced gains for the latter, reducing the multilingual performance gap on zero-shot phonetic discrimination from 31.5% for audio-only models to 8.04% with grounding.

📄 PDF Abstract BibTeX arXiv:2509.17523

Code (0)

등록된 구현이 없습니다.

Tasks

Self-Supervised LearningRepresentation LearningSpeech RecognitionVisual Grounding

Similar Papers 제목 키워드 기반

Multilingual Audio-Visual Speech Recognition with Hybrid CTC/RNN-T Fast Conformer

2024-03-14 · Maxime Burchi, Krishna C. Puvvada, Jagadeesh Balam, Boris Ginsburg 외

Humans are adept at leveraging visual cues from lip movements for recognizing speech in adverse listening conditions. Audio-Visual Speech Recognition (AVSR) models follow similar approach to achieve robust speech recogni…

Audio-Visual Speech RecognitionRobust Speech Recognitionspeech-recognitionSpeech Recognition+1

Towards Multilingual Audio-Visual Question Answering

2024-06-13 · Orchid Chetia Phukan, Priyabrata Mallick, Swarup Ranjan Behera, Aalekhya Satya Narayani 외

In this paper, we work towards extending Audio-Visual Question Answering (AVQA) to multilingual settings. Existing AVQA research has predominantly revolved around English and replicating it for addressing AVQA in other l…

Audio-visual Question AnsweringAudio-Visual Question Answering (AVQA)Machine TranslationQuestion Answering+1

Zero-AVSR: Zero-Shot Audio-Visual Speech Recognition with LLMs by Learning Language-Agnostic Speech Representations

2025-03-08 · Jeong Hun Yeo, Minsu Kim, Chae Won Kim, Stavros Petridis 외

We explore a novel zero-shot Audio-Visual Speech Recognition (AVSR) framework, dubbed Zero-AVSR, which enables speech recognition in target languages without requiring any audio-visual speech data in those languages. Spe…

Audio-Visual Speech RecognitionMulti-Task Learningspeech-recognitionSpeech Recognition+1

JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion

2026-01-29 · Anthony Chen, Naomi Ken Korem, Gal Zeevi, Tavi Halperin 외 arxiv

Audio-Visual Foundation Models, which are pretrained to jointly generate sound and visual content, have recently shown an unprecedented ability to model multi-modal generation and editing, opening new opportunities for d…

mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition

2025-02-03 · Andrew Rouditchenko, Samuel Thomas, Hilde Kuehne, Rogerio Feris 외

Audio-Visual Speech Recognition (AVSR) combines lip-based video with audio and can improve performance in noise, but most methods are trained only on English data. One limitation is the lack of large-scale multilingual v…

Audio-Visual Speech RecognitionDecoderRobust Speech Recognitionspeech-recognition+2