TY - RPRT TI - AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models AU - Qi Liu AU - Jingqing Ruan AU - Hao Li AU - Haodong Zhao AU - Desheng Wang AU - Jiansong Chen AU - Wan Guanglu AU - Xunliang Cai AU - Zhi Zheng AU - Tong Xu PY - 2025 UR - https://arxiv.org/abs/2506.07165 ID - 2506.07165 ER -