TY - RPRT TI - Finite-Sample Analysis of Off-Policy TD-Learning via Generalized Bellman Operators AU - Zaiwei Chen AU - Siva Theja Maguluri AU - Sanjay Shakkottai AU - Karthikeyan Shanmugam PY - 2021 UR - https://arxiv.org/abs/2106.12729 ID - 2106.12729 ER -