@article{whisbertmultimodaltextaudiolanguage, title = {WhisBERT: Multimodal Text-Audio Language Modeling on 100M Words}, author = {Lukas Wolf and Greta Tuckute and Klemen Kotar and Eghbal Hosseini and Tamar Regev and Ethan Wilcox and Alex Warstadt}, year = {2023}, eprint = {2312.02931}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2312.02931v2}, }