TY - RPRT TI - Learning and Planning in Average-Reward Markov Decision Processes AU - Yi Wan AU - Abhishek Naik AU - Richard S. Sutton PY - 2021 UR - https://arxiv.org/abs/2006.16318 ID - 2006.16318 ER -