TY - RPRT TI - MPO: Multilingual Safety Alignment via Reward Gap Optimization AU - Weixiang Zhao AU - Yulin Hu AU - Yang Deng AU - Tongtong Wu AU - Wenxuan Zhang AU - Jiahe Guo AU - An Zhang AU - Yanyan Zhao AU - Bing Qin AU - Tat-Seng Chua AU - Ting Liu PY - 2025 UR - https://arxiv.org/abs/2505.16869 ID - 2505.16869 ER -