TY - RPRT TI - SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment AU - Wenqiao Zhu AU - Ji Liu AU - Lulu Wang AU - Jun Wu AU - Yulun Zhang PY - 2025 UR - https://arxiv.org/abs/2505.12435 ID - 2505.12435 ER -