TY - RPRT TI - Reinforcement Learning with Token-level Feedback for Controllable Text Generation AU - Wendi Li AU - Wei Wei AU - Kaihe Xu AU - Wenfeng Xie AU - Dangyang Chen AU - Yu Cheng PY - 2024 UR - https://arxiv.org/abs/2403.11558 ID - 2403.11558 ER -