TY - RPRT TI - Online Target Q-learning with Reverse Experience Replay: Efficiently finding the Optimal Policy for Linear MDPs AU - Naman Agarwal AU - Syomantak Chaudhuri AU - Prateek Jain AU - Dheeraj Nagaraj AU - Praneeth Netrapalli PY - 2021 UR - https://arxiv.org/abs/2110.08440 ID - 2110.08440 ER -