TY - RPRT TI - Sequence to Sequence Reward Modeling: Improving RLHF by Language Feedback AU - Jiayi Zhou AU - Jiaming Ji AU - Juntao Dai AU - Dong Li AU - Yaodong Yang PY - 2025 UR - https://arxiv.org/abs/2409.00162 ID - 2409.00162 ER -