TY - RPRT TI - Provably Safe Reinforcement Learning for Stochastic Reach-Avoid Problems with Entropy Regularization AU - Abhijit Mazumdar AU - Rafal Wisniewski AU - Manuela L. Bujorianu PY - 2026 UR - https://arxiv.org/abs/2601.08646 ID - 2601.08646 ER -