TY - RPRT TI - Pessimistic Minimax Value Iteration: Provably Efficient Equilibrium Learning from Offline Datasets AU - Han Zhong AU - Wei Xiong AU - Jiyuan Tan AU - Liwei Wang AU - Tong Zhang AU - Zhaoran Wang AU - Zhuoran Yang PY - 2022 UR - https://arxiv.org/abs/2202.07511 ID - 2202.07511 ER -