@article{fuseafteralignimprovingfacevoice, title = {Fuse after Align: Improving Face-Voice Association Learning via Multimodal Encoder}, author = {Chong Peng and Liqiang He and Dan Su}, year = {2024}, eprint = {2404.09509}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2404.09509v1}, }