@article{scalableaudiovisualmaskedautoencodersfor, title = {Scalable Audio-Visual Masked Autoencoders for Efficient Affective Video Facial Analysis}, author = {Xuecheng Wu and Junxiao Xue and Xinyi Yin and Yunyun Shi and Liangyu Fu and Danlei Huang and Yifan Wang and Jia Zhang and Jiayu Nie and Jun Wang}, year = {2025}, eprint = {2509.24214}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2509.24214}, }