TY - RPRT TI - Reinforcement Learning From State and Temporal Differences AU - Lex Weaver AU - Jonathan Baxter PY - 2025 UR - https://arxiv.org/abs/2512.08855 ID - 2512.08855 ER -