TY - RPRT TI - Stochastic Gradient Descent with Dependent Data for Offline Reinforcement Learning AU - Jing Dong AU - Xin T. Tong PY - 2022 UR - https://arxiv.org/abs/2202.02850 ID - 2202.02850 ER -