@misc{indiciae6607da8395eb, title = {LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback}, author = {Manith Adikari and Bei Peng and Samuele Vinanzi and Angelo Cangelosi}, year = {2026}, url = {https://arxiv.org/abs/2607.29559}, note = {Source identifier: 2607.29559} }