TY - RPRT TI - Reinforcement Learning from User Feedback AU - Eric Han AU - Jun Chen AU - Karthik Abinav Sankararaman AU - Xiaoliang Peng AU - Tengyu Xu AU - Eryk Helenowski AU - Kaiyan Peng AU - Mrinal Kumar AU - Sinong Wang AU - Han Fang AU - Arya Talebzadeh PY - 2025 UR - https://arxiv.org/abs/2505.14946 ID - 2505.14946 ER -