TY - RPRT TI - Action Candidate Driven Clipped Double Q-learning for Discrete and Continuous Action Tasks AU - Haobo Jiang AU - Jin Xie AU - Jian Yang PY - 2022 UR - https://arxiv.org/abs/2203.11526 ID - 2203.11526 ER -