TY - RPRT TI - Offline Reinforcement Learning from Human Feedback in Real-World Sequence-to-Sequence Tasks AU - Julia Kreutzer AU - Stefan Riezler AU - Carolin Lawrence PY - 2021 UR - https://arxiv.org/abs/2011.02511 ID - 2011.02511 ER -