TY - RPRT TI - MHPO: Modulated Hazard-aware Policy Optimization for Stable Reinforcement Learning AU - Hongjun Wang AU - Wei Liu AU - Weibo Gu AU - Xing Sun AU - Kai Han PY - 2026 UR - https://arxiv.org/abs/2603.16929 ID - 2603.16929 ER -