TY - RPRT TI - Adversarial Preference Optimization: Enhancing Your Alignment via RM-LLM Game AU - Pengyu Cheng AU - Yifan Yang AU - Jian Li AU - Yong Dai AU - Tianhao Hu AU - Peixin Cao AU - Nan Du AU - Xiaolong Li PY - 2024 UR - https://arxiv.org/abs/2311.08045 ID - 2311.08045 ER -