TY - RPRT TI - A Generalized Minimax Q-learning Algorithm for Two-Player Zero-Sum Stochastic Games AU - Raghuram Bharadwaj Diddigi AU - Chandramouli Kamanchi AU - Shalabh Bhatnagar PY - 2022 DO - 10.1109/tac.2022.3159453 UR - https://arxiv.org/abs/1906.06659 ID - 1906.06659 ER -