TY - RPRT TI - Self-supervised Preference Optimization: Enhance Your Language Model with Preference Degree Awareness AU - Jian Li AU - Haojing Huang AU - Yujia Zhang AU - Pengfei Xu AU - Xi Chen AU - Rui Song AU - Lida Shi AU - Jingwen Wang AU - Hao Xu PY - 2024 UR - https://arxiv.org/abs/2409.17791 ID - 2409.17791 ER -