TY - RPRT TI - Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs AU - Arash Ahmadian AU - Chris Cremer AU - Matthias Gallé AU - Marzieh Fadaee AU - Julia Kreutzer AU - Olivier Pietquin AU - Ahmet Üstün AU - Sara Hooker PY - 2024 UR - https://arxiv.org/abs/2402.14740 ID - 2402.14740 ER -