TY - RPRT TI - Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards AU - Haoxiang Wang AU - Yong Lin AU - Wei Xiong AU - Rui Yang AU - Shizhe Diao AU - Shuang Qiu AU - Han Zhao AU - Tong Zhang PY - 2024 UR - https://arxiv.org/abs/2402.18571 ID - 2402.18571 ER -