TY - RPRT TI - Policy Finetuning: Bridging Sample-Efficient Offline and Online Reinforcement Learning AU - Tengyang Xie AU - Nan Jiang AU - Huan Wang AU - Caiming Xiong AU - Yu Bai PY - 2022 UR - https://arxiv.org/abs/2106.04895 ID - 2106.04895 ER -