TY - RPRT TI - ReLOAD: Reinforcement Learning with Optimistic Ascent-Descent for Last-Iterate Convergence in Constrained MDPs AU - Ted Moskovitz AU - Brendan O'Donoghue AU - Vivek Veeriah AU - Sebastian Flennerhag AU - Satinder Singh AU - Tom Zahavy PY - 2023 UR - https://arxiv.org/abs/2302.01275 ID - 2302.01275 ER -