TY - RPRT TI - Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration AU - Guopeng Li AU - Matthijs T. J. Spaan AU - Julian F. P. Kooij PY - 2026 UR - https://arxiv.org/abs/2603.23889 ID - 2603.23889 ER -