TY - RPRT TI - Weak-to-Strong Preference Optimization: Stealing Reward from Weak Aligned Model AU - Wenhong Zhu AU - Zhiwei He AU - Xiaofeng Wang AU - Pengfei Liu AU - Rui Wang PY - 2025 UR - https://arxiv.org/abs/2410.18640 ID - 2410.18640 ER -