TY - RPRT TI - AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization AU - Junkang Wu AU - Xue Wang AU - Zhengyi Yang AU - Jiancan Wu AU - Jinyang Gao AU - Bolin Ding AU - Xiang Wang AU - Xiangnan He PY - 2025 UR - https://arxiv.org/abs/2410.10148 ID - 2410.10148 ER -