@misc{indiciae0f2aca6a1d2b, title = {TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback}, author = {Eunseop Yoon and Hee Suk Yoon and SooHwan Eom and Gunsoo Han and Daniel Wontae Nam and Daejin Jo and Kyoung-Woon On and Mark A. Hasegawa-Johnson and Sungwoong Kim and Chang D. Yoo}, year = {2024}, url = {https://arxiv.org/abs/2407.16574}, note = {Source identifier: 2407.16574} }