TY - RPRT TI - Balance Reward and Safety Optimization for Safe Reinforcement Learning: A Perspective of Gradient Manipulation AU - Shangding Gu AU - Bilgehan Sel AU - Yuhao Ding AU - Lu Wang AU - Qingwei Lin AU - Ming Jin AU - Alois Knoll PY - 2025 UR - https://arxiv.org/abs/2405.01677 ID - 2405.01677 ER -