@article{vatlmvisualaudiotextpretrainingwith, title = {VATLM: Visual-Audio-Text Pre-Training with Unified Masked Prediction for Speech Representation Learning}, author = {Qiushi Zhu and Long Zhou and Ziqiang Zhang and Shujie Liu and Binxing Jiao and Jie Zhang and LiRong Dai and Daxin Jiang and Jinyu Li and Furu Wei}, year = {2022}, eprint = {2211.11275}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2211.11275v2}, }