TY - RPRT TI - Optimal Estimation of Off-Policy Policy Gradient via Double Fitted Iteration AU - Chengzhuo Ni AU - Ruiqi Zhang AU - Xiang Ji AU - Xuezhou Zhang AU - Mengdi Wang PY - 2022 UR - https://arxiv.org/abs/2202.00076 ID - 2202.00076 ER -