TY - RPRT TI - Fixed-Horizon Temporal Difference Methods for Stable Reinforcement Learning AU - Kristopher De Asis AU - Alan Chan AU - Silviu Pitis AU - Richard S. Sutton AU - Daniel Graves PY - 2020 UR - https://arxiv.org/abs/1909.03906 ID - 1909.03906 ER -