@misc{indiciae36240da34973, title = {Reinforcement Learning from User Feedback}, author = {Eric Han and Jun Chen and Karthik Abinav Sankararaman and Xiaoliang Peng and Tengyu Xu and Eryk Helenowski and Kaiyan Peng and Mrinal Kumar and Sinong Wang and Han Fang and Arya Talebzadeh}, year = {2025}, url = {https://arxiv.org/abs/2505.14946}, note = {Source identifier: 2505.14946} }