@misc{indiciaeedd89b8c6cef, title = {The Optimal Reward Baseline for Gradient-Based Reinforcement Learning}, author = {Lex Weaver and Nigel Tao}, year = {2013}, url = {https://arxiv.org/abs/1301.2315}, note = {Source identifier: 1301.2315} }