TY - RPRT TI - Online Iterative Reinforcement Learning from Human Feedback with General Preference Model AU - Chenlu Ye AU - Wei Xiong AU - Yuheng Zhang AU - Hanze Dong AU - Nan Jiang AU - Tong Zhang PY - 2024 UR - https://arxiv.org/abs/2402.07314 ID - 2402.07314 ER -