TY - RPRT TI - SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions AU - Elham Daneshmand AU - Majid Khadiv AU - Glen Berseth AU - Hsiu-Chin Lin PY - 2026 UR - https://arxiv.org/abs/2607.08925 ID - 2607.08925 ER -