TY - RPRT TI - A maximum-entropy approach to off-policy evaluation in average-reward MDPs AU - Nevena Lazic AU - Dong Yin AU - Mehrdad Farajtabar AU - Nir Levine AU - Dilan Gorur AU - Chris Harris AU - Dale Schuurmans PY - 2020 UR - https://arxiv.org/abs/2006.12620 ID - 2006.12620 ER -