@misc{indiciae9adee5429b81, title = {Preference Distillation via Value based Reinforcement Learning}, author = {Minchan Kwon and Junwon Ko and Kangil Kim and Junmo Kim}, year = {2025}, url = {https://arxiv.org/abs/2509.16965}, note = {Source identifier: 2509.16965} }