TY - RPRT TI - Leftover Lunch: Advantage-based Offline Reinforcement Learning for Language Models AU - Ashutosh Baheti AU - Ximing Lu AU - Faeze Brahman AU - Ronan Le Bras AU - Maarten Sap AU - Mark Riedl PY - 2024 UR - https://arxiv.org/abs/2305.14718 ID - 2305.14718 ER -