TY - RPRT TI - Constraints Penalized Q-learning for Safe Offline Reinforcement Learning AU - Haoran Xu AU - Xianyuan Zhan AU - Xiangyu Zhu PY - 2022 UR - https://arxiv.org/abs/2107.09003 ID - 2107.09003 ER -