TY - RPRT TI - Why Policy Gradient Algorithms Work for Undiscounted Total-Reward MDPs AU - Jongmin Lee AU - Ernest K. Ryu PY - 2026 UR - https://arxiv.org/abs/2510.18340 ID - 2510.18340 ER -