TY - RPRT TI - Reward-Augmented Data Enhances Direct Preference Alignment of LLMs AU - Shenao Zhang AU - Zhihan Liu AU - Boyi Liu AU - Yufeng Zhang AU - Yingxiang Yang AU - Yongfei Liu AU - Liyu Chen AU - Tao Sun AU - Zhaoran Wang PY - 2025 UR - https://arxiv.org/abs/2410.08067 ID - 2410.08067 ER -