TY - RPRT TI - On Reinforcement Learning and Distribution Matching for Fine-Tuning Language Models with no Catastrophic Forgetting AU - Tomasz Korbak AU - Hady Elsahar AU - Germán Kruszewski AU - Marc Dymetman PY - 2022 UR - https://arxiv.org/abs/2206.00761 ID - 2206.00761 ER -