TY - RPRT TI - Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs AU - Rui Yang AU - Ruomeng Ding AU - Yong Lin AU - Huan Zhang AU - Tong Zhang PY - 2024 UR - https://arxiv.org/abs/2406.10216 ID - 2406.10216 ER -