TY - RPRT TI - RLCD: Reinforcement Learning from Contrastive Distillation for Language Model Alignment AU - Kevin Yang AU - Dan Klein AU - Asli Celikyilmaz AU - Nanyun Peng AU - Yuandong Tian PY - 2024 UR - https://arxiv.org/abs/2307.12950 ID - 2307.12950 ER -