TY - RPRT TI - A short variational proof of equivalence between policy gradients and soft Q learning AU - Pierre H. Richemond AU - Brendan Maginnis PY - 2017 UR - https://arxiv.org/abs/1712.08650 ID - 1712.08650 ER -