TY - RPRT TI - Stochastic Minimum-Cost Reach-Avoid Reinforcement Learning AU - Jingduo Pan AU - Taoran Wu AU - Yiling Xue AU - Bai Xue PY - 2026 UR - https://arxiv.org/abs/2605.11975 ID - 2605.11975 ER -