TY - RPRT TI - Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model AU - Yueqin Yin AU - Shentao Yang AU - Yujia Xie AU - Ziyi Yang AU - Yuting Sun AU - Hany Awadalla AU - Weizhu Chen AU - Mingyuan Zhou PY - 2025 UR - https://arxiv.org/abs/2501.02790 ID - 2501.02790 ER -