@article{speakervid5malargescalehighqualitydatase, title = {SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation}, author = {Youliang Zhang and Zhaoyang Li and Duomin Wang and Jiahe Zhang and Deyu Zhou and Zixin Yin and Xili Dai and Gang Yu and Xiu Li}, year = {2025}, eprint = {2507.09862}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2507.09862}, }