TY - RPRT TI - Variance-Reduced Off-Policy TDC Learning: Non-Asymptotic Convergence Analysis AU - Shaocong Ma AU - Yi Zhou AU - Shaofeng Zou PY - 2023 UR - https://arxiv.org/abs/2010.13272 ID - 2010.13272 ER -