TY - RPRT TI - Direct Policy Gradients: Direct Optimization of Policies in Discrete Action Spaces AU - Guy Lorberbom AU - Chris J. Maddison AU - Nicolas Heess AU - Tamir Hazan AU - Daniel Tarlow PY - 2020 UR - https://arxiv.org/abs/1906.06062 ID - 1906.06062 ER -