@misc{indiciaed89a1210b57d, title = {Multi-turn Reinforcement Learning from Preference Human Feedback}, author = {Lior Shani and Aviv Rosenberg and Asaf Cassel and Oran Lang and Daniele Calandriello and Avital Zipori and Hila Noga and Orgad Keller and Bilal Piot and Idan Szpektor and Avinatan Hassidim and Yossi Matias and Rémi Munos}, year = {2024}, url = {https://arxiv.org/abs/2405.14655}, note = {Source identifier: 2405.14655} }