TY - RPRT TI - Polynomial Time Reinforcement Learning in Factored State MDPs with Linear Value Functions AU - Zihao Deng AU - Siddartha Devic AU - Brendan Juba PY - 2022 UR - https://arxiv.org/abs/2107.05187 ID - 2107.05187 ER -