TY - RPRT TI - Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation AU - Juntao Dai AU - Yaodong Yang AU - Qian Zheng AU - Gang Pan PY - 2024 UR - https://arxiv.org/abs/2412.11138 ID - 2412.11138 ER -