TY - RPRT TI - Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data AU - Zhiyuan Zhou AU - Andy Peng AU - Qiyang Li AU - Sergey Levine AU - Aviral Kumar PY - 2025 UR - https://arxiv.org/abs/2412.07762 ID - 2412.07762 ER -