TY - RPRT TI - Reward-agnostic Fine-tuning: Provable Statistical Benefits of Hybrid Reinforcement Learning AU - Gen Li AU - Wenhao Zhan AU - Jason D. Lee AU - Yuejie Chi AU - Yuxin Chen PY - 2023 UR - https://arxiv.org/abs/2305.10282 ID - 2305.10282 ER -