TY - RPRT TI - Reward Modeling from Natural Language Human Feedback AU - Zongqi Wang AU - Rui Wang AU - Yuchuan Wu AU - Yiyao Yu AU - Pinyi Zhang AU - Shaoning Sun AU - Yujiu Yang AU - Yongbin Li PY - 2026 UR - https://arxiv.org/abs/2601.07349 ID - 2601.07349 ER -