TY - RPRT TI - The Optimal Reward Baseline for Gradient-Based Reinforcement Learning AU - Lex Weaver AU - Nigel Tao PY - 2013 UR - https://arxiv.org/abs/1301.2315 ID - 1301.2315 ER -