TY - RPRT TI - Simultaneous Reward Distillation and Preference Learning: Get You a Language Model Who Can Do Both AU - Abhijnan Nath AU - Changsoo Jung AU - Ethan Seefried AU - Nikhil Krishnaswamy PY - 2025 UR - https://arxiv.org/abs/2410.08458 ID - 2410.08458 ER -