@misc{indiciae8ae65de843e3, title = {Off-Policy Safe Reinforcement Learning with Constrained Optimistic Exploration}, author = {Guopeng Li and Matthijs T. J. Spaan and Julian F. P. Kooij}, year = {2026}, url = {https://arxiv.org/abs/2603.23889}, note = {Source identifier: 2603.23889} }