TY - RPRT TI - Weighted-Reward Preference Optimization for Implicit Model Fusion AU - Ziyi Yang AU - Fanqi Wan AU - Longguang Zhong AU - Tianyuan Shi AU - Xiaojun Quan PY - 2025 UR - https://arxiv.org/abs/2412.03187 ID - 2412.03187 ER -