TY - RPRT TI - Multi-turn Reinforcement Learning from Preference Human Feedback AU - Lior Shani AU - Aviv Rosenberg AU - Asaf Cassel AU - Oran Lang AU - Daniele Calandriello AU - Avital Zipori AU - Hila Noga AU - Orgad Keller AU - Bilal Piot AU - Idan Szpektor AU - Avinatan Hassidim AU - Yossi Matias AU - Rémi Munos PY - 2024 UR - https://arxiv.org/abs/2405.14655 ID - 2405.14655 ER -