TY - RPRT TI - Exploiting the Sign of the Advantage Function to Learn Deterministic Policies in Continuous Domains AU - Matthieu Zimmer AU - Paul Weng PY - 2019 DO - 10.24963/ijcai.2019/625 UR - https://arxiv.org/abs/1906.04556 ID - 1906.04556 ER -