TY - RPRT TI - Towards Fast Safe Online Reinforcement Learning via Policy Finetuning AU - Keru Chen AU - Honghao Wei AU - Zhigang Deng AU - Sen Lin PY - 2026 UR - https://arxiv.org/abs/2412.04426 ID - 2412.04426 ER -