TY - RPRT TI - Discriminative Finetuning of Generative Large Language Models without Reward Models and Human Preference Data AU - Siqi Guo AU - Ilgee Hong AU - Vicente Balmaseda AU - Changlong Yu AU - Liang Qiu AU - Xin Liu AU - Haoming Jiang AU - Tuo Zhao AU - Tianbao Yang PY - 2025 UR - https://arxiv.org/abs/2502.18679 ID - 2502.18679 ER -