paper-with-me

홈 › Papers

VTaMo: Video-Text Alignment Model for Sign Language Translation

2026-07-10 · Junyi Hu, Zhewen He, Haomian Huang, Aoxiang Yang, Yi Fang arxiv

Sign language translation (SLT) converts continuous sign videos into spoken language text. Gloss-free approaches leverage pre-trained visual encoders and language models but rely on implicit cross-modal alignment from translation supervision alone. We present VTaMo, a framework that introduces explicit multi-granularity alignment at three levels: (1) local alignment via entropy-regularized optimal transport with a learnable null token for fine-grained frame-to-token correspondences; (2) global alignment via a learnable orthogonal transformation that calibrates embedding space geometry through Earth Mover's Distance; and (3) position-aligned contrastive learning for discriminative token-level representations. Experiments on Phoenix-2014T, CSL-Daily, How2Sign, and OpenASL demonstrate consistent state-of-the-art performance, with ablations confirming the complementary contributions of each component. Code is available at https://github.com/junyi2005/vtamo.

📄 PDF Abstract BibTeX arXiv:2607.09126

Code (0)

등록된 구현이 없습니다.

Tasks

Sign Language TranslationContrastive Learning

Similar Papers 제목 키워드 기반

Video-Language Alignment via Spatio-Temporal Graph Transformer

2024-07-16 · Shi-Xue Zhang, Hongfa Wang, Xiaobin Zhu, Weibo Gu 외

Video-language alignment is a crucial multi-modal task that benefits various downstream applications, e.g., video-text retrieval and video question answering. Existing methods either utilize multi-modal information in vi…

Contrastive LearningQuestion AnsweringRetrievalText Retrieval+2

DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval

2025-06-10 · CVPR 2025 1 · Leqi Shen, Guoqiang Gong, Tianxiang Hao, Tao He 외

The parameter-efficient adaptation of the image-text pretraining model CLIP for video-text retrieval is a prominent area of research. While CLIP is focused on image-level vision-language matching, video-text retrieval de…

Image CaptioningRetrievalText RetrievalVideo Alignment+1

Denoising-Contrastive Alignment for Continuous Sign Language Recognition

2023-05-05 · Leming Guo, Wanli Xue, ShengYong Chen

Continuous sign language recognition (CSLR) aims to recognize signs in untrimmed sign language videos to textual glosses. A key challenge of CSLR is achieving effective cross-modality alignment between video and gloss se…

DenoisingRepresentation LearningSign Language Recognition

VideoCon: Robust Video-Language Alignment via Contrast Captions

2023-11-15 · CVPR 2024 1 · Hritik Bansal, Yonatan Bitton, Idan Szpektor, Kai-Wei Chang 외

Despite being (pre)trained on a massive amount of data, state-of-the-art video-language alignment models are not robust to semantically-plausible contrastive changes in the video captions. Our work addresses this by iden…

Language ModelingLanguage ModellingLarge Language ModelQuestion Answering+4

Dynamic Reflections: Probing Video Representations with Text Alignment

2025-11-04 · Tyler Zhu, Tengda Han, Leonidas Guibas, Viorica Pătrăucean 외 arxiv

The alignment of representations from different modalities has recently been shown to provide insights on the structural similarities and downstream capabilities of different encoders across diverse data types. While sig…