TY - RPRT TI - Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator AU - Zhuotong Chen AU - Fang Liu AU - Xuan Zhu AU - Yanjun Qi AU - Mohammad Ghavamzadeh PY - 2025 UR - https://arxiv.org/abs/2502.04567 ID - 2502.04567 ER -