TY - RPRT TI - Near-Optimal Reinforcement Learning with Self-Play AU - Yu Bai AU - Chi Jin AU - Tiancheng Yu PY - 2020 UR - https://arxiv.org/abs/2006.12007 ID - 2006.12007 ER -