TY - RPRT TI - Secrets of RLHF in Large Language Models Part II: Reward Modeling AU - Binghai Wang AU - Rui Zheng AU - Lu Chen AU - Yan Liu AU - Shihan Dou AU - Caishuang Huang AU - Wei Shen AU - Senjie Jin AU - Enyu Zhou AU - Chenyu Shi AU - Songyang Gao AU - Nuo Xu AU - Yuhao Zhou AU - Xiaoran Fan AU - Zhiheng Xi AU - Jun Zhao AU - Xiao Wang AU - Tao Ji AU - Hang Yan AU - Lixing Shen AU - Zhan Chen AU - Tao Gui AU - Qi Zhang AU - Xipeng Qiu AU - Xuanjing Huang AU - Zuxuan Wu AU - Yu-Gang Jiang PY - 2024 UR - https://arxiv.org/abs/2401.06080 ID - 2401.06080 ER -