paper-with-me

Audio-Visual Speech Recognition

4개 벤치마크 · 논문 118편 · 이 태스크의 논문 보기 →

Benchmarks

LRS3-TED

결과 12개

LRS2

결과 8개

LRW

결과 3개

CAS-VSR-S101

결과 1개

Most implemented

Deep Audio-Visual Speech Recognition

2018-09-06 · 구현 4개

Papers

Candor-LR: A Dyadic Conversational Dataset for Audio-Visual Speech Recognition

2026-09-09 · Rishabh Jain, Aristeidis Papadopoulos, Zhaofeng Lin, Naomi Harte arxiv

Current audio-visual speech recognition (AVSR) benchmarks, like LRS3, rely heavily on clean, scripted and rehearsed speech. They fail to reflect the complexity of natural conversation, which involves overlapping speech, …

Audio-Visual Speech Recognition

VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness

2026-07-09 · Iulia-Maria Udrea, Alexandra Diaconu, Bogdan Alexe arxiv

We introduce VSRo-200, the first large-scale dataset for visual speech recognition (lip reading) in Romanian, comprising 200 hours of real-world podcast videos. All samples are annotated with pseudo-labels generated by a…

Audio-Visual Speech RecognitionDomain GeneralizationLip Reading

VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition

2026-06-28 · Piyush Arora, Navlika Singh, Umberto Cappellazzo, Stavros Petridis 외 arxiv

Audio-Visual Speech Recognition takes two input modalities, acoustic and visual streams, where visual information from lip movements aids recognition when audio is noisy. Recently, LLM-based AVSR models have emerged as a…

Audio-Visual Speech Recognition

When AVSR Meets Video Conferencing: Dataset, Degradation, and the Hidden Mechanism Behind Performance Collapse

2026-03-24 · Yihuan Huang, Jun Xue, Liu Jiajun, Daixian Li 외 arxiv

Audio-Visual Speech Recognition (AVSR) has achieved remarkable progress in offline conditions, yet its robustness in real-world video conferencing (VC) remains largely unexplored. This paper presents the first systematic…

Audio-Visual Speech RecognitionSpeech Enhancement

Dr. SHAP-AV: Decoding Relative Modality Contributions via Shapley Attribution in Audio-Visual Speech Recognition

2026-03-12 · Umberto Cappellazzo, Stavros Petridis, Maja Pantic arxiv

Audio-Visual Speech Recognition (AVSR) leverages both acoustic and visual information for robust recognition under noise. However, how models balance these modalities remains unclear. We present Dr. SHAP-AV, a framework …

Audio-Visual Speech Recognition

OCR-Enhanced Multimodal ASR Can Read While Listening

2026-01-26 · Junli Chen, Changli Tang, Yixuan Li, Guangzhi Sun 외 arxiv

Visual information, such as subtitles in a movie, often helps automatic speech recognition. In this paper, we propose Donut-Whisper, an audio-visual ASR model with dual encoder to leverage visual information to improve s…

Audio-Visual Speech RecognitionKnowledge Distillation

전체 118편 보기 →