@article{vitttsvisualtexttospeechwithscalable, title = {ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer}, author = {Huadai Liu and Rongjie Huang and Xuan Lin and Wenqiang Xu and Maozong Zheng and Hong Chen and Jinzheng He and Zhou Zhao}, year = {2023}, eprint = {2305.12708}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2305.12708v2}, }