@misc{indiciaec52476b067a2, title = {Prior Constraints-based Reward Model Training for Aligning Large Language Models}, author = {Hang Zhou and Chenglong Wang and Yimin Hu and Tong Xiao and Chunliang Zhang and Jingbo Zhu}, year = {2024}, url = {https://arxiv.org/abs/2404.00978}, note = {Source identifier: 2404.00978} }