TY - RPRT TI - Provably More Efficient Q-Learning in the One-Sided-Feedback/Full-Feedback Settings AU - Xiao-Yue Gong AU - David Simchi-Levi PY - 2020 UR - https://arxiv.org/abs/2007.00080 ID - 2007.00080 ER -