@misc{indiciaef93a9724c7fc, title = {Greedy-Step Off-Policy Reinforcement Learning}, author = {Yuhui Wang and Qingyuan Wu and Pengcheng He and Xiaoyang Tan}, year = {2021}, url = {https://arxiv.org/abs/2102.11717}, note = {Source identifier: 2102.11717} }