TY - RPRT TI - Examining average and discounted reward optimality criteria in reinforcement learning AU - Vektor Dewanto AU - Marcus Gallagher PY - 2022 UR - https://arxiv.org/abs/2107.01348 ID - 2107.01348 ER -