TY - RPRT TI - Preference-Oriented Supervised Fine-Tuning: Favoring Target Model Over Aligned Large Language Models AU - Yuchen Fan AU - Yuzhong Hong AU - Qiushi Wang AU - Junwei Bao AU - Hongfei Jiang AU - Yang Song PY - 2024 UR - https://arxiv.org/abs/2412.12865 ID - 2412.12865 ER -