TY - RPRT TI - Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment AU - Teng Xiao AU - Yige Yuan AU - Huaisheng Zhu AU - Mingxiao Li AU - Vasant G Honavar PY - 2024 UR - https://arxiv.org/abs/2412.14516 ID - 2412.14516 ER -