TY - RPRT TI - Successive Convex Approximation Based Off-Policy Optimization for Constrained Reinforcement Learning AU - Chang Tian AU - An Liu AU - Guang Huang AU - Wu Luo PY - 2021 DO - 10.1109/tsp.2022.3158737 UR - https://arxiv.org/abs/2105.12545 ID - 2105.12545 ER -