TY - RPRT TI - Extreme Value Policy Optimization for Safe Reinforcement Learning AU - Shiqing Gao AU - Yihang Zhou AU - Shuai Shao AU - Haoyu Luo AU - Yiheng Bing AU - Jiaxin Ding AU - Luoyi Fu AU - Xinbing Wang PY - 2026 UR - https://arxiv.org/abs/2601.12008 ID - 2601.12008 ER -