TY - RPRT TI - Adaptive Preference Scaling for Reinforcement Learning with Human Feedback AU - Ilgee Hong AU - Zichong Li AU - Alexander Bukharin AU - Yixiao Li AU - Haoming Jiang AU - Tianbao Yang AU - Tuo Zhao PY - 2024 UR - https://arxiv.org/abs/2406.02764 ID - 2406.02764 ER -