TY - RPRT TI - Variance-reduced $Q$-learning is minimax optimal AU - Martin J. Wainwright PY - 2019 UR - https://arxiv.org/abs/1906.04697 ID - 1906.04697 ER -