TY - RPRT TI - Beyond Sparse Rewards: Enhancing Reinforcement Learning with Language Model Critique in Text Generation AU - Meng Cao AU - Lei Shu AU - Lei Yu AU - Yun Zhu AU - Nevan Wichers AU - Yinxiao Liu AU - Lei Meng PY - 2024 UR - https://arxiv.org/abs/2401.07382 ID - 2401.07382 ER -