TY - RPRT TI - Near-Optimal Offline Reinforcement Learning via Double Variance Reduction AU - Ming Yin AU - Yu Bai AU - Yu-Xiang Wang PY - 2021 UR - https://arxiv.org/abs/2102.01748 ID - 2102.01748 ER -