TY - RPRT TI - Selective Preference Optimization via Token-Level Reward Function Estimation AU - Kailai Yang AU - Zhiwei Liu AU - Qianqian Xie AU - Jimin Huang AU - Erxue Min AU - Sophia Ananiadou PY - 2025 UR - https://arxiv.org/abs/2408.13518 ID - 2408.13518 ER -