TY - RPRT TI - Inferring the Optimal Policy using Markov Chain Monte Carlo AU - Brandon Trabucco AU - Albert Qu AU - Simon Li AU - Ganeshkumar Ashokavardhanan PY - 2019 UR - https://arxiv.org/abs/1912.02714 ID - 1912.02714 ER -