TY - RPRT TI - Learning Value Functions in Deep Policy Gradients using Residual Variance AU - Yannis Flet-Berliac AU - Reda Ouhamma AU - Odalric-Ambrym Maillard AU - Philippe Preux PY - 2021 UR - https://arxiv.org/abs/2010.04440 ID - 2010.04440 ER -