TY - RPRT TI - A New Policy Iteration Algorithm For Reinforcement Learning in Zero-Sum Markov Games AU - Anna Winnicki AU - R. Srikant PY - 2023 UR - https://arxiv.org/abs/2303.09716 ID - 2303.09716 ER -