TY - RPRT TI - Variational Policy Gradient Method for Reinforcement Learning with General Utilities AU - Junyu Zhang AU - Alec Koppel AU - Amrit Singh Bedi AU - Csaba Szepesvari AU - Mengdi Wang PY - 2020 UR - https://arxiv.org/abs/2007.02151 ID - 2007.02151 ER -