@misc{indiciae161435cf8bd4, title = {Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment}, author = {Yueqin Yin and Zhendong Wang and Yujia Xie and Weizhu Chen and Mingyuan Zhou}, year = {2024}, url = {https://arxiv.org/abs/2405.20830}, note = {Source identifier: 2405.20830} }