paper-with-me

Lipreading

8개 벤치마크 · 논문 103편 · 이 태스크의 논문 보기 →

Benchmarks

LRS2

결과 50개

LRS3-TED

결과 46개

CAS-VSR-W1k (LRW-1000)

결과 18개

CMLR

결과 10개

LRW-1000

결과 8개

CAS-VSR-S101

결과 2개

Most implemented

Deep Audio-Visual Speech Recognition

2018-09-06 · 구현 4개

Papers

Learning Speaker-Invariant Visual Features for Lipreading

2025-06-09 · Yu Li, Feng Xue, Shujie Li, Jinrui Zhang 외

Lipreading is a challenging cross-modal task that aims to convert visual lip movements into spoken text. Existing lipreading methods often extract visual features that include speaker-specific lip attributes (e.g., shape…

DisentanglementLipreadingSpeaker Recognition

UniCUE: Unified Recognition and Generation Framework for Chinese Cued Speech Video-to-Speech Generation

2025-06-04 · Jinting Wang, Shan Yang, Li Liu

Cued Speech (CS) enhances lipreading through hand coding, providing precise speech perception support for the hearing-impaired. CS Video-to-Speech generation (CSV2S) task aims to convert the CS visual expressions (CS vid…

cross-modal alignmentLipreadingtext-to-speechText to Speech

OXSeg: Multidimensional attention UNet-based lip segmentation using semi-supervised lip contours

2025-05-08 · Hanie Moghaddasi, Christina Chambers, Sarah N. Mattson, Jeffrey R. Wozniak 외

Lip segmentation plays a crucial role in various domains, such as lip synchronization, lipreading, and diagnostics. However, the effectiveness of supervised lip segmentation is constrained by the availability of lip cont…

Generative Adversarial NetworkLipreadingSegmentation

Audio-Visual Representation Learning via Knowledge Distillation from Speech Foundation Models

2025-02-09 · Jing-Xuan Zhang, Genshun Wan, Jianqing Gao, Zhen-Hua Ling

Audio-visual representation learning is crucial for advancing multimodal speech processing tasks, such as lipreading and audio-visual speech recognition. Recently, speech foundation models (SFMs) have shown remarkable ge…

Audio-Visual Speech RecognitionAutomatic Speech RecognitionAutomatic Speech Recognition (ASR)Knowledge Distillation+5

Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation

2025-02-09 · Jing-Xuan Zhang, Tingzhi Mao, Longjiang Guo, Jin Li 외

Lipreading is an important technique for facilitating human-computer interaction in noisy environments. Our previously developed self-supervised learning method, AV2vec, which leverages multimodal self-distillation, has …

Cross-Lingual TransferLipreadingSelf-Supervised LearningTransfer Learning

Evaluation of End-to-End Continuous Spanish Lipreading in Different Data Conditions

2025-02-01 · David Gimeno-Gómez, Carlos-D. Martínez-Hinarejos

Visual speech recognition remains an open research problem where different challenges must be considered by dispensing with the auditory sense, such as visual ambiguities, the inter-personal variability among speakers, a…

Lipreadingspeech-recognitionSpeech RecognitionVisual Speech Recognition

전체 103편 보기 →