TY - RPRT TI - LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback AU - Manith Adikari AU - Bei Peng AU - Samuele Vinanzi AU - Angelo Cangelosi PY - 2026 UR - https://arxiv.org/abs/2607.29559 ID - 2607.29559 ER -