TY - RPRT TI - Almost Sure Convergence of Differential Temporal Difference Learning for Average Reward Markov Decision Processes AU - Ethan Blaser AU - Jiuqi Wang AU - Shangtong Zhang PY - 2026 UR - https://arxiv.org/abs/2602.16629 ID - 2602.16629 ER -