@article{efficientlyidentifyinglowqualitylanguage, title = {Efficiently Identifying Low-Quality Language Subsets in Multilingual Datasets: A Case Study on a Large-Scale Multilingual Audio Dataset}, author = {Farhan Samir and Emily P. Ahn and Shreya Prakash and Márton Soskuthy and Vered Shwartz and Jian Zhu}, year = {2024}, eprint = {2410.04292}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2410.04292v1}, }