TY - RPRT TI - $i$REPO: $i$mplicit Reward Pairwise Difference based Empirical Preference Optimization AU - Long Tan Le AU - Han Shu AU - Tung-Anh Nguyen AU - Choong Seon Hong AU - Nguyen H. Tran PY - 2024 UR - https://arxiv.org/abs/2405.15230 ID - 2405.15230 ER -