TY - RPRT TI - Self-Augmented Preference Optimization: Off-Policy Paradigms for Language Model Alignment AU - Yueqin Yin AU - Zhendong Wang AU - Yujia Xie AU - Weizhu Chen AU - Mingyuan Zhou PY - 2024 UR - https://arxiv.org/abs/2405.20830 ID - 2405.20830 ER -