TY - RPRT TI - Action Candidate Based Clipped Double Q-learning for Discrete and Continuous Action Tasks AU - Haobo Jiang AU - Jin Xie AU - Jian Yang PY - 2021 UR - https://arxiv.org/abs/2105.00704 ID - 2105.00704 ER -