TY - RPRT TI - Learning from Reference Answers: Versatile Language Model Alignment without Binary Human Preference Data AU - Shuai Zhao AU - Yunqiu Xu AU - Linchao Zhu AU - Yi Yang PY - 2025 UR - https://arxiv.org/abs/2504.09895 ID - 2504.09895 ER -