TY - RPRT TI - Reinforcement Learning in Factored MDPs: Oracle-Efficient Algorithms and Tighter Regret Bounds for the Non-Episodic Setting AU - Ziping Xu AU - Ambuj Tewari PY - 2020 UR - https://arxiv.org/abs/2002.02302 ID - 2002.02302 ER -