@article{efficientaudiovisualspeechseparationwith, title = {Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention}, author = {Kai Li and Kejun Gao and Xiaolin Hu}, year = {2025}, eprint = {2509.23610}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2509.23610}, }