TY - RPRT TI - SB-TRPO: Towards Safe Reinforcement Learning with Hard Constraints AU - Dominik Wagner AU - Ankit Kanwar AU - Luke Ong PY - 2026 UR - https://arxiv.org/abs/2512.23770 ID - 2512.23770 ER -