TY - RPRT TI - MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework AU - Yupeng Qi AU - Ziyu Lyu AU - Min Yang AU - Yanlin Wang AU - Lu Bai AU - Lixin Cui PY - 2025 UR - https://arxiv.org/abs/2506.02460 ID - 2506.02460 ER -