TY - RPRT TI - Average-reward reinforcement learning in semi-Markov decision processes via relative value iteration AU - Huizhen Yu AU - Yi Wan AU - Richard S. Sutton PY - 2025 UR - https://arxiv.org/abs/2512.06218 ID - 2512.06218 ER -