TY - RPRT TI - Direct Large Language Model Alignment Through Self-Rewarding Contrastive Prompt Distillation AU - Aiwei Liu AU - Haoping Bai AU - Zhiyun Lu AU - Xiang Kong AU - Simon Wang AU - Jiulong Shan AU - Meng Cao AU - Lijie Wen PY - 2024 UR - https://arxiv.org/abs/2402.11907 ID - 2402.11907 ER -