@article{multimodalandmultiscalespatial, title = {Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech}, author = {Rui Liu and Shuwei He and Yifan Hu and Haizhou Li}, year = {2024}, eprint = {2412.11409}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2412.11409v3}, }