@inproceedings{fromfacestovoiceslearninghierarchical, title = {From Faces to Voices: Learning Hierarchical Representations for High-quality Video-to-Speech}, author = {Ji-Hoon Kim and Jeongsoo Choi and Jaehun Kim and Chaeyoung Jung and Joon Son Chung}, year = {2025}, booktitle = {CVPR 2025 1}, eprint = {2503.16956}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2503.16956v1}, }