TY - RPRT TI - From Set Convergence to Pointwise Convergence: Finite-Time Guarantees for Average-Reward Q-Learning with Adaptive Stepsizes AU - Zaiwei Chen AU - Phalguni Nanda PY - 2026 UR - https://arxiv.org/abs/2504.18743 ID - 2504.18743 ER -