@article{learningtounifyaudiovisualandtextfor, title = {Learning to Unify Audio, Visual and Text for Audio-Enhanced Multilingual Visual Answer Localization}, author = {Zhibin Wen and Bin Li}, year = {2024}, eprint = {2411.02851}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2411.02851v1}, }