TY - RPRT TI - Batch Policy Learning in Average Reward Markov Decision Processes AU - Peng Liao AU - Zhengling Qi AU - Runzhe Wan AU - Predrag Klasnja AU - Susan Murphy PY - 2022 UR - https://arxiv.org/abs/2007.11771 ID - 2007.11771 ER -