TY - RPRT TI - On a convergent off -policy temporal difference learning algorithm in on-line learning environment AU - Prasenjit Karmakar AU - Rajkumar Maity AU - Shalabh Bhatnagar PY - 2016 UR - https://arxiv.org/abs/1605.06076 ID - 1605.06076 ER -