TY - RPRT TI - Fine-tuning Reinforcement Learning Models is Secretly a Forgetting Mitigation Problem AU - Maciej Wołczyk AU - Bartłomiej Cupiał AU - Mateusz Ostaszewski AU - Michał Bortkiewicz AU - Michał Zając AU - Razvan Pascanu AU - Łukasz Kuciński AU - Piotr Miłoś PY - 2024 UR - https://arxiv.org/abs/2402.02868 ID - 2402.02868 ER -