@article{vividvoiceaunifiedframeworkforsceneaware, title = {VividVoice: A Unified Framework for Scene-Aware Visually-Driven Speech Synthesis}, author = {Chengyuan Ma and Jiawei Jin and Ruijie Xiong and Chunxiang Jin and Canxiang Yan and Wenming Yang}, year = {2026}, eprint = {2602.02591}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2602.02591}, }