TY - RPRT TI - Policy Gradient using Weak Derivatives for Reinforcement Learning AU - Sujay Bhatt AU - Alec Koppel AU - Vikram Krishnamurthy PY - 2020 UR - https://arxiv.org/abs/2004.04843 ID - 2004.04843 ER -