TY - RPRT TI - Prior Constraints-based Reward Model Training for Aligning Large Language Models AU - Hang Zhou AU - Chenglong Wang AU - Yimin Hu AU - Tong Xiao AU - Chunliang Zhang AU - Jingbo Zhu PY - 2024 UR - https://arxiv.org/abs/2404.00978 ID - 2404.00978 ER -