TY - RPRT TI - Constrained Variational Policy Optimization for Safe Reinforcement Learning AU - Zuxin Liu AU - Zhepeng Cen AU - Vladislav Isenbaev AU - Wei Liu AU - Zhiwei Steven Wu AU - Bo Li AU - Ding Zhao PY - 2022 UR - https://arxiv.org/abs/2201.11927 ID - 2201.11927 ER -