@misc{indiciaed9c21a029c05, title = {AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization}, author = {Junkang Wu and Xue Wang and Zhengyi Yang and Jiancan Wu and Jinyang Gao and Bolin Ding and Xiang Wang and Xiangnan He}, year = {2025}, url = {https://arxiv.org/abs/2410.10148}, note = {Source identifier: 2410.10148} }