TY - RPRT TI - Stochastic first-order methods for average-reward Markov decision processes AU - Tianjiao Li AU - Feiyang Wu AU - Guanghui Lan PY - 2024 UR - https://arxiv.org/abs/2205.05800 ID - 2205.05800 ER -