TY - RPRT TI - Deterministic Policy Optimization by Combining Pathwise and Score Function Estimators for Discrete Action Spaces AU - Daniel Levy AU - Stefano Ermon PY - 2017 UR - https://arxiv.org/abs/1711.08068 ID - 1711.08068 ER -