TY - RPRT TI - Instance-optimality in optimal value estimation: Adaptivity via variance-reduced Q-learning AU - Koulik Khamaru AU - Eric Xia AU - Martin J. Wainwright AU - Michael I. Jordan PY - 2021 UR - https://arxiv.org/abs/2106.14352 ID - 2106.14352 ER -