TY - RPRT TI - RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models AU - Saeed Khaki AU - JinJin Li AU - Lan Ma AU - Liu Yang AU - Prathap Ramachandra PY - 2024 UR - https://arxiv.org/abs/2402.10038 ID - 2402.10038 ER -