@article{mpomultilingualsafetyalignmentviareward, title = {MPO: Multilingual Safety Alignment via Reward Gap Optimization}, author = {Weixiang Zhao and Yulin Hu and Yang Deng and Tongtong Wu and Wenxuan Zhang and Jiahe Guo and An Zhang and Yanyan Zhao and Bing Qin and Tat-Seng Chua and Ting Liu}, year = {2025}, eprint = {2505.16869}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2505.16869v1}, }