TY - RPRT TI - Efficient Off-Policy Safe Reinforcement Learning Using Trust Region Conditional Value at Risk AU - Dohyeong Kim AU - Songhwai Oh PY - 2023 DO - 10.1109/lra.2022.3184793 UR - https://arxiv.org/abs/2312.00342 ID - 2312.00342 ER -