TY - RPRT TI - TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback AU - Eunseop Yoon AU - Hee Suk Yoon AU - SooHwan Eom AU - Gunsoo Han AU - Daniel Wontae Nam AU - Daejin Jo AU - Kyoung-Woon On AU - Mark A. Hasegawa-Johnson AU - Sungwoong Kim AU - Chang D. Yoo PY - 2024 UR - https://arxiv.org/abs/2407.16574 ID - 2407.16574 ER -