TY - RPRT TI - Achieving $\varepsilon^{-2}$ Dependence for Average-Reward Q-Learning with a New Contraction Principle AU - Zijun Chen AU - Zaiwei Chen AU - Nian Si AU - Shengbo Wang PY - 2026 UR - https://arxiv.org/abs/2601.21301 ID - 2601.21301 ER -