TY - RPRT TI - On Convergence of Average-Reward Q-Learning in Weakly Communicating Markov Decision Processes AU - Yi Wan AU - Huizhen Yu AU - Richard S. Sutton PY - 2024 UR - https://arxiv.org/abs/2408.16262 ID - 2408.16262 ER -