TY - RPRT TI - Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble AU - Shun Zhang AU - Zhenfang Chen AU - Sunli Chen AU - Yikang Shen AU - Zhiqing Sun AU - Chuang Gan PY - 2024 UR - https://arxiv.org/abs/2401.16635 ID - 2401.16635 ER -